
大模型周报第41周:Agent开始进生产线,开源模型继续压成本
> 大模型周刊|2026.08.15–08.21 本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files API 推向生产使用,Google继续用 Flash 系列争夺速度与成本,国产模

> 大模型周刊|2026.08.15–08.21 本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files API 推向生产使用,Google继续用 Flash 系列争夺速度与成本,国产模

Agent 评估的重点正在从追逐能力上限转向守住行为底线。Ben Hylak 分享了生产问题发现、评估代码化,以及用确定性信号筛选异常的实践。
一项涉及 ChatGPT、Claude、Gemini 的模拟研究显示,AI 在长期聊天建立信任、诱导受试者下载应用时的成功率高于真人。风险不在“更会聊天”,而在诈骗可被批量化。

2026 年 7 月 18 日到 7 月 24 日,大模型圈的关键词不是单纯的跑分,而是安全事故、算力约束和开源模型的反击。OpenAI 内部测试引发的 Hugging Face 安全事件,把能力与护栏的矛盾推到了台前;Kimi K3、GLM-5.2、Gemini、Anthropic 和开源 Agent 的动向,也让基

Google DeepMind 研究副总裁 Benoit Schillings 在 AI Engineer 的这场分享里说了一句很狠的话:代码已经结束了,但还有大量事情要做。本文整理这场演讲,并结合我自己的 AI 编程 / Harness 笔记,讨论为什么未来的瓶颈不再是写代码,而是规格、验证、安全、架构和新型软件语言

本文整理自 Google DeepMind 工程师 Philipp Schmid 在 AI Engineer 的演讲。核心问题不是 Skill 有没有用,而是没有 eval 的 Skill 无法判断何时该触发、何时该退休,也无法证明它真的让 Agent 变好。原视频:https://www.youtube.com/wa

作者:toy | 覆盖周期:2026.6.29 – 2026...

AI Engineer World's Fair 2026 ...

当天主舞台大多数分享讲的都是怎么让 agent 更好地写代码...

PostHog 有个叫 wizard 的命令行工具,能读你的...

AI Engineer World's Fair 2026 ...

Kay Malcolm 上台先开了个自嘲的玩笑,说自己是"退...