
Karpathy 讲透 Software 3.0:当英文成为编程语言,AI 工程师真正该设计什么
Andrej Karpathy 在 Stanford 的这场演讲,表面上是一场关于 Transformer、GPT 和提示工程的技术分享,真正值得留下的核心判断只有一句:软件正在从“人来设计算法”,转向“人来设计数据和语言程序”。模型能力越强,工程师越需要把注意力从代码细节上移到任务定义、反馈回路、上下文和验证机制上。

Andrej Karpathy 在 Stanford 的这场演讲,表面上是一场关于 Transformer、GPT 和提示工程的技术分享,真正值得留下的核心判断只有一句:软件正在从“人来设计算法”,转向“人来设计数据和语言程序”。模型能力越强,工程师越需要把注意力从代码细节上移到任务定义、反馈回路、上下文和验证机制上。

大模型周刊|2026.08.15–08.21
本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files API 推向生产使用,Google继续用 Flash 系列争夺速度与成本,国产模型则借助后训练和开源,把编程、网络安全与 Agent 能力继续往前推。
如果只看一句话:闭源厂商在强化可控性和产品交付,开源阵营在压缩能力与成本差距。
8月18日,ChatGPT for Teens 正式上线。系统会自动识别 13–17 岁用户,并默认加强对自残、暴力、色情内容和浪漫角色扮演的防护。产品还加入 Study Mode、作业提醒,以及家长侧的 Quiet Hours 和 Study Hours 控制。
OpenAI也给出了更明确的互动边界:模型不应假装拥有情感或意识。学习场景中,产品提供可视化学习工具和测验功能,方向从“回答问题”扩展到“辅助学习过程”。
付费用户获得了 Private Safety Processing。它尝试结合多轮对话识别风险模式,降低只看单次请求带来的误判。
产品侧还有两个变化:ChatGPT 的 Apple Messages 插件上线,可以在获得授权后代发或整理 iMessage;Codex则继续出现在代码迁移等实际业务案例中,外界关注点从“能不能写代码”转向“能否用更低成本完成长期工程”。
Teen 模式仍有待验证。年龄预测是否可靠、家长控制是否会被持续使用、作业提醒能否被轻易绕过,都决定了产品效果。已有测试显示,系统会拒绝直接代写论文,但在解题类请求中仍可能给出接近完整答案。
我的判断是:OpenAI正在补齐安全产品的基础设施。方向比缺位强,距离“默认安全”还有距离,难点集中在有用性、风险识别和教育边界之间的动态平衡。
Anthropic本周将 Computer Use、Skills API 和 Files API 推向一般可用,并配套提供浏览器工具 Browser Use。开发者可以在 Claude Platform 上组合批量动作、文件处理和浏览器操作,构建更完整的生产级 Agent。
Claude Academy 也同步推出,重点放在安全、有效地使用 AI。Anthropic的路线很明确:模型能力需要进入软件、浏览器和文件系统,Agent才有机会承担连续任务。
Computer Use 从实验功能进入 GA 后,评估重点会发生变化。开发者关心的不再只是演示效果,还包括动作成功率、失败恢复、权限隔离、审计能力和成本控制。Agent能否稳定运行,决定了这条路线的长期价值。
Gemini 3.7 Flash 于8月13日发布,并在本周持续推开。产品定位是高速度、高性价比的工作马,重点覆盖编码、Agent 和知识工作流。年底前的价格优惠进一步强化了它在开发者场景中的吸引力。
在 DeepSWE、FrontierCode 等基准上,Gemini 3.7 Flash 相比前代有提升。Google还公布了手语 AI、WeatherNext 气旋预测等应用侧进展。
Google的节奏越来越像“三周一个小版本”:Flash先快速迭代,Pro保持更谨慎的发布节奏。短期看,Flash更适合成本敏感的 Agent 和批量任务;旗舰 Pro 何时全面上线,以及能否在复杂任务上拉齐竞品,仍是后续观察点。
8月14日,智谱发布 GLM-5.3,API 于本周上线,模型权重计划下周五开源。GLM-5.3沿用 GLM-5.2 基座,主要通过后训练提升编程与网络安全能力。
按本周材料,GLM-5.3 已进入 Artificial Analysis Intelligence Index 的全球前沿区间,在开源模型中处于前列。编码相关基准相比前代提升明显,网络安全能力接近甚至在部分测试中超过 Mythos 5 与 GPT-5.6 Sol。
智谱还启动了“开源的盾”安全审计计划,试图在模型开放与风险控制之间建立配套机制。
GLM-5.3最值得关注的地方是后训练效率。基座能力达到一定水平后,强化学习和任务导向后训练可以快速改善编程、工具调用与安全任务表现。权重开源后的真实部署体验、显存要求和社区微调效果,才会决定这次跃升能否转化为长期生态优势。
DeepSeek-V4-Pro-0813 正式版上线后,Agent能力继续提升。DeepSWE、Terminal 等相关基准均有进步,部分结果接近 Fable 5。
DeepSeek同步开源 DeepSeek Harness,采用 MIT 许可和“一切皆插件”的架构,方便开发者二次开发 Agent。模型之外,Harness降低了任务编排、工具扩展和运行时集成的门槛。
DeepSeek的差异化越来越清楚:价格保持竞争力,模型围绕 Agent 场景优化,配套工具直接开放。峰谷定价计划如果落地,还会进一步影响批量 Agent 任务的成本模型。
月之暗面本周主要延续 Kimi K3 的影响。K3的开源、2.8T 参数规模和综合评测表现仍在开发者社区持续发酵,融资进展以及美国侧制裁威胁讨论也在增加。
K3是今年开源模型的重要节点,但算力供给、部署成本和商业化落地仍是现实约束。中国模型开源之后,技术竞争和地缘政治风险会同时进入产品决策。
MiniMax发布 MiniMax Design,定位为多模态创作 Harness,覆盖素材处理、生成、编辑和交付流程,底层使用海螺 H3 等视频模型。它的价值取决于能否把意图理解、任务拆解和模型调度真正串起来。完成这一步,产品才会从“模型入口”变成可交付的创作工具。
OpenClaw 7.1 发布后,Control UI 继续升级,并支持更多前沿模型。它正在从一个“能运行 Agent”的框架,向本地或远程 Agent 控制台演进,插件生态和本地 LLM 部署也获得更多讨论。
Hermes Desktop则将 Bot Mode 正式内置。用户可以把单个 Agent 配置成带名称的 Bot 团队,支持互相 @、共享 Inbox 和多 Agent 协作。
两条路线都指向同一个变化:Agent的产品形态开始从单体助手转向可编排的工作单元。接下来比拼的会是任务分工、上下文共享、权限管理和失败恢复,而非 Bot 数量本身。
本周的四个信号可以压缩成一张判断表:
| 方向 | 本周变化 | 对开发者的影响 |
|---|---|---|
| 安全 | OpenAI推进青少年安全,智谱启动开源审计 | 安全策略逐渐进入产品默认值 |
| Agent | Anthropic工具 GA,DeepSeek发布 Harness | Agent开始接入浏览器、文件和真实业务流程 |
| 成本 | Gemini Flash、DeepSeek继续压低使用成本 | 批量任务和长流程 Agent 更容易落地 |
| 生态 | GLM-5.3权重、DeepSeek Harness、Hermes Bot Mode | 开发者获得更多模型与运行时选择 |
本周最值得跟踪的有四件事:GLM-5.3权重开源后的部署反馈,Claude Computer Use 的真实成功率,DeepSeek Harness 的插件生态,以及 ChatGPT for Teens 的实际安全效果。
下一阶段的分水岭会落在真实工作流里:谁能稳定完成任务,失败时能恢复,成本还能算得过来,谁就更接近生产级 Agent。
下周一见。
DeepSeek API 近日发布重要更新,正式上线了一款名为“V4-Flash-Vision-Exp”的实验性多模态视觉理解模型,标志着该平台在文本处理能力之外,正式开启视觉理解 API 服务。根据官方文档变更记录,此次更新共涉及新增 1 项、更新 3 项内容。核心看点在于用户现在可以通过设置 `model=’deepseek-v4-flash-vision-exp’` 参数来调用该模型的全新视觉感知能力。虽然该模型目前标记为实验性质,但其上线意味着 DeepSeek 正在积极完善其多模态技术栈,试图追赶业界主流趋势。除模型发布外,DeepSeek 还同步更新了官方提示库与模型价格页。提示库的更新预计将为开发者提供针对视觉任务的优化模板,而价格页的更新则明确了新模型的计费标准,便于开发者进行成本核算。此次文档更新显示出 DeepSeek 生态系统正在从单一的代码或文本推理向更广泛的图文交互方向演进,为开发下一代具备视觉能力的 AI 应用提供了基础设施支持。
核心观点:DeepSeek 通过实验性 API 补齐视觉感知短板,加速向全能型 AI 生态演进。
原文链接:Linux.do
DeepSeek正式发布了代号为`deepseek-v4-flash-vision-exp`的多模态视觉模型,标志着其API能力从纯文本拓展至图文理解领域。该模型不仅能看图说话、识别文字,还能分析图表,支持JPEG、PNG、GIF及WebP等主流格式。在技术接入层面,DeepSeek提供了极高的灵活性,支持Base64内联编码、公网URL链接以及Files API文件引用三种输入方式,且完全兼容OpenAI标准的Chat Completions格式和Anthropic的Messages结构,极大降低了开发者的迁移门槛。针对大文件处理,Files API允许上传最大64MiB的单张图片,且在复用场景下能有效节省流量。文档还详细规定了API调用限制:请求体上限为48MiB,外部图片不超过32MiB,单次请求最多支持600张图片,且在处理高分辨率图像时采用了缩放策略,将像素统一至800×800左右,锁定每张图片最高384个Token的计费上限。此外,该模型还集成于Responses API中,支持在工具调用输出环节处理图像,适配更复杂的自动化工作流。
核心观点:DeepSeek以极致兼容性和低Token成本切入多模态赛道,有望凭借价格优势加速视觉模型在通用API场景的普及。
原文链接:Hacker News

Andrej Karpathy 在 Stanford 的这场演讲,表面上是一场关于 Transformer、GPT 和提示工程的技术分享,真正值得留下的核心判断只有一句:软件正在从“人来设计算法”,转向“人来设计数据和语言程序”。模型能力越强,工程师越需要把注意力从代码细节上移到任务定义、反馈回路、上下文和验证机制上。
先说明一个观看时容易踩到的坑:视频页面标题写着 “Andrej Karpathy at Stanford: The Foundation that Became Anthropic”,但实际字幕内容并没有围绕 Anthropic 的创建史或 Claude 展开,主体是一场 Karpathy 讲解 Software 1.0、Software 2.0、Software 3.0、Transformer 与 Prompt Engineering 的演讲。下面的文章以视频实际内容为准,不沿着页面标题补写不存在的故事。
Karpathy 把过去几十年的软件发展拆成了三个阶段。
Software 1.0 是最熟悉的编程方式:工程师把问题拆成明确步骤,再用 C++、Python、Java 或其他语言把算法写出来。程序员告诉计算机每一步应该做什么,计算机按照这些确定的指令运行。Linux 这样的复杂系统,就是在这个范式里逐渐建成的。
这种方法对规则清晰的问题非常有效。排序、网络协议、数据库索引、编译器、操作系统,都可以通过人类设计算法来实现。困难出现在那些规则无法被完整写出的任务上。图像中的猫可以有无数姿态、光照和背景,棋局的好坏依赖长链路判断,自动驾驶需要处理开放环境中的大量例外。面对这些问题,工程师很难把“识别一只猫”写成一套覆盖所有情况的 if-else。
Software 2.0 由此出现。它把神经网络看成一种新型程序:程序员不再手写最终的决策规则,而是准备数据集、定义训练目标、运行优化过程,最后得到一组神经网络权重。权重就是程序,只是这份程序无法直接用文本手工编写。
Karpathy 用自己在 Tesla 做自动驾驶的经历解释了这个过程。团队先训练一个模型,把它部署到真实环境中;系统运行后会产生大量遥测数据,模型在困难场景中的表现会暴露问题;工程师再收集这些困难样本、完成标注,将其中一部分放入测试集,另一部分加入训练集,重新训练模型。这个循环不断重复,模型能力随着数据和反馈一起迭代。
这套流程的重点不在“模型训练”四个字,而在 data engine,也就是数据引擎。数据采集、难例发现、标注策略、测试集设计、线上监控,构成了 Software 2.0 的真正生产系统。只会调模型结构,却没有持续获得高价值数据的团队,很难长期保持优势。
这里还有一个重要边界:Software 2.0 没有消灭 Software 1.0。训练脚本、数据管道、评测程序、部署系统、监控服务,依然需要大量传统代码。更准确的理解是,两种软件叠加在一起:传统代码负责组织流程,神经网络负责处理难以显式表达的判断。
Karpathy 认为,最近一轮变化来自大型语言模型。语言模型最初的训练目标看起来很朴素:根据前面的内容预测下一个词。模型规模扩大、参数量增加、训练数据覆盖整个互联网后,这个预测任务开始表现出超出直觉的能力。
模型可以生成文章、回答问题,也可以在上下文中完成任务。给它一段材料,再给出几组“问题—答案”示例,模型就可能按照这个格式继续回答。这里没有发生传统意义上的梯度更新,模型参数没有被重新训练;任务行为通过上下文被临时激活了。
这就是 in-context learning。模型内部已经学到大量语言模式和任务模式,Prompt 负责从中挑出一条合适的路径。Karpathy 将这种方式称为 Software 3.0:Software 1.0 由人设计算法,Software 2.0 由人设计数据集,Software 3.0 则由人设计 Prompt,让模型运行一段自然语言程序。
他的那句名言“最热门的新编程语言是英语”,重点不在英语本身有多神奇,而在编程接口发生了变化。过去的程序接口要求调用者严格遵守函数签名、参数类型和控制流;语言模型接口允许工程师用自然语言描述角色、目标、约束、输入格式和输出格式,再由模型完成剩余部分。
这也解释了为什么 Prompt Engineering 很快成为一项正式工作。Prompt 不是一句“请帮我写得更好”,它可以是一份运行时程序,包含状态定义、工具协议、输出 Schema、异常处理、安全边界和任务分解方式。Bing 的 Sydney、智能家居助手、自然语言驱动的后端,都可以被看作通过文本实例化出来的虚拟系统。
视频里有一个很直观的例子:让 ChatGPT 假装成为 Linux 终端。用户输入 pwd、ls、cd 等命令,模型根据前文维护一个虚构的文件系统;当用户创建 jokes.txt,后续 ls 和 cat 会反映前面的状态。现实中没有真正的磁盘,也没有真正执行 shell,模型只是在上下文中维护一套关于系统状态的模拟。
这个例子很有启发性,也暴露了风险。只要任务停留在文字模拟层,结果可以很像真的;一旦把结果交给真实系统执行,模拟与事实之间的差距就会变成故障。模型说“命令已经执行”并不等于命令真的执行,模型给出的 IP、文件、计算结果和 API 响应,都必须经过外部工具或独立验证。
Karpathy 展示了一个数学题:一个杂耍演员能抛 16 个球,其中一半是高尔夫球,高尔夫球中一半是蓝色,蓝色高尔夫球有多少个?模型直接回答时可能得到错误结果,因为它很快完成了文本续写。加入“请一步一步思考”的提示后,准确率明显提高;进一步要求“为了确认答案正确,让我们一步一步算出来”,表现还会提升。
这里的关键不在于给模型增加人格,而在于给推理过程增加结构。模型每生成一个 token,能够使用的计算空间有限。把复杂任务拆成多个中间步骤,相当于允许模型在更长的序列里逐步展开计算。对于需要多步推理的系统,Prompt 设计已经接近程序设计:要决定中间变量是什么、检查点在哪里、何时允许继续、何时必须回滚。
同一逻辑也适用于知识问答。模型如果没有明确约束,往往会生成互联网平均水平的回答。要求它以某个领域专家的视角回答,可以改变输出分布,但这并不意味着模型真的获得了专家身份。Prompt 只是选择了模型内部某一片知识和表达模式,事实准确性仍需要来源、检索和评测支撑。
因此,一个可靠的 Prompt 至少应包含以下信息:任务目标、输入边界、判断标准、输出格式、失败处理和禁止事项。若系统需要调用工具,还要额外描述工具的参数、权限、幂等性和结果校验方式。把这些内容都塞进一段自然语言,当然可以工作;长期运行时,最好把它们拆成可版本管理、可测试、可观测的配置和模块。
演讲的后半部分回到 Transformer 的技术基础。Karpathy 先回顾了 2012 年前后的深度学习转折点。当时的计算机视觉系统往往由大量手工特征拼接而成:颜色直方图、纹理描述子、几何特征,再接一个分类器。自然语言处理、语音、视觉和强化学习各自拥有独立的术语和方法,跨领域阅读的门槛很高。
大规模神经网络证明了一个可复制的事实:只要拥有足够大的数据、模型和计算资源,同一类学习框架可以迁移到多个领域。2017 年的 Transformer 进一步推动了架构收敛。图像可以切成 patch,语音可以切成频谱片段,强化学习可以把状态、动作和奖励组织成序列,分子或其他结构化信息也可以编码成 token。核心架构相似,变化主要出现在数据切分、编码方式、位置表示和训练目标上。
Transformer 的通用性来自两个阶段的交替。
第一阶段是 communication。每个 token 通过 query、key、value 与其他 token 交换信息,注意力权重决定哪些信息值得被聚合。第二阶段是 computation,每个位置独立经过多层感知机,对自身的表示做变换。多头注意力可以理解为多组并行的消息传递机制,多层堆叠则让信息在更深的计算过程中反复交流。
这个架构同时具备三个优势:表达能力强,能够实现复杂函数;优化相对稳定,残差连接和 LayerNorm 帮助梯度传播;硬件效率高,计算图相对扁平且宽,适合 GPU 并行。深度学习的规模竞争里,硬件效率会直接影响模型能做到多大,因此第三点往往和模型理论能力同样重要。
Karpathy 还用 nanoGPT 说明了一个训练语言模型的最小闭环:把文本编码成整数序列,切成固定长度的上下文块,用前面的 token 预测下一个 token,再通过交叉熵损失训练。生成时,模型输出一个 token,再把它放回上下文,继续预测下一个 token。上下文窗口就是模型能直接访问的短期记忆,窗口有长度上限,超过之后就必须裁剪、压缩或借助外部存储。
这也是 Agent 系统必须认真处理的工程问题。模型上下文不是无限记忆,长对话、工具调用记录、检索结果和中间推理如果全部堆在 Prompt 里,成本、延迟和噪声都会快速上升。更合理的系统需要把短期上下文、长期记忆、工作区文件、数据库状态和可重新获取的外部资料分开管理。
Software 3.0 很容易让人产生一种错觉:既然语言可以编程,写几段 Prompt 就能替代后端系统。视频中提到的“GPT 作为后端”项目,确实展示了一个有趣方向:前端把状态和自然语言路由交给模型,模型返回新的 JSON 状态。待办事项可以通过“删除最后两项”这样的表达来操作,传统路由代码被模型部分吸收。
但生产系统不能只看演示效果。模型输出需要 Schema 校验,状态更新需要事务边界,权限操作需要显式授权,重要动作需要幂等与审计。自然语言提供了灵活性,也带来了歧义。对于删数据、发消息、改配置、控制机器人等动作,模型最多负责提出计划,执行层仍应由确定性代码把关。
从架构角度看,Agent 并非“一个更聪明的聊天框”,更接近一个由模型驱动的控制回路:模型读取状态,提出下一步动作,工具执行动作,系统返回观察结果,模型再做判断。这个回路是否可靠,取决于状态建模、工具契约、反馈信号和失败恢复,而非 Prompt 的文采。
Karpathy 在演讲中提到外部记忆和 scratch pad。模型拥有有限上下文时,可以把中间结果写入外部记事本,后续再按需读取。这个想法今天已经变成 Agent 的工作区、向量检索、任务数据库、运行日志和长期记忆。真正有效的记忆系统并非把所有历史都保存下来,而是明确什么值得保存、以什么结构保存、何时检索、如何确认内容仍然有效。
对于机器人云平台,这个判断尤其重要。机器人诊断 Agent 不应只把所有日志拼成一段长 Prompt,然后期待模型自动找出答案。更稳的做法是把机器人状态、任务上下文、告警时间线、传感器摘要、历史工单和诊断工具拆成结构化对象;模型负责选择调查路径和组织解释,规则引擎、时序库与设备接口负责提供事实。这样既能利用自然语言的灵活性,也能保留工程系统需要的确定性。
看完这场演讲,最值得带走的能力清单有五项。
第一,能把模糊目标写成可验证的任务。模型并不自动知道“好答案”是什么,工程师需要把成功条件、边界案例和失败状态定义出来。
第二,能设计数据与反馈回路。对于传统模型,这是 data engine;对于 Agent,这是工具调用日志、人工修正、失败样本、评测集和线上观测。没有反馈回路,Prompt 只能靠感觉迭代。
第三,能把 Prompt 当成版本化程序。角色、上下文、工具、输出协议和安全规则都应可追踪,改动后需要回归测试,不能只靠“这次看起来不错”。
第四,能区分模型判断与系统事实。模型可以推测、归纳和规划,数据库、传感器、API 与执行器负责确认事实。两者边界越清晰,系统越容易调试。
第五,能在必要时回到底层。Karpathy 自己既讲 Prompt,也讲 attention 的矩阵运算和 nanoGPT 的 300 行实现。抽象层越高,越需要知道下面发生了什么,否则出了问题只能凭感觉改提示词。
这场演讲真正有价值的地方,恰好不在“英文成为新编程语言”这句容易传播的话。更深的变化是:软件系统的核心资产正在从静态代码扩展为“目标、数据、上下文、反馈和工具”的组合。未来的工程师既要会写代码,也要会设计模型可以执行的任务环境。
视频页面的标题把观众引向 Anthropic,字幕却把内容带回 Software 3.0。这个错位反倒提醒了一件很现实的事:任何 AI 内容都要先核对一手材料,再接受标题和摘要的叙事。对模型如此,对视频如此,对工程系统返回的每一条“看起来合理”的结果,也如此。
视频来源:Andrej Karpathy at Stanford: The Foundation that Became Anthropic(实际内容:Software 3.0、Transformer 与 Prompt Engineering)
频道:DarrowStation
原视频:https://www.youtube.com/watch?v=v-IeZBwO2UM
由哈佛大学工程与应用科学学院(SEAS)团队开发的FreeInference平台近日受到开发者社区关注。该项目旨在为研究人员提供免费的LLM(大语言模型)推理服务,以降低学术实验的算力成本。根据用户实测反馈,该平台目前响应速度快、可用性高,API调用稳定,能够有效支持日常模型测试与研究任务。
平台的准入机制采用了严格的身份验证策略:持有.edu教育邮箱的用户注册后可获得“秒批”权限,立即获取API密钥并投入使用;而使用普通邮箱注册的用户则需要经过人工审核流程,门槛相对较高。这种利用学术身份作为验证手段的策略,有效过滤了非学术用途的流量,保障了校内计算资源对外分发时的稳定性与可用性。对于拥有学术身份的开发者和科研人员而言,这相当于获得了一个无需付费、性能可靠的云端推理后端,特别适合进行提示词工程、Agent开发等需要高频调用的实验场景。
核心观点:哈佛通过绑定.edu邮箱释放免费算力,不仅降低了学术研究的试错成本,更重塑了教育邮箱在AI时代的稀缺资源属性。
原文链接:Linux.do
近日,在科技社区 Linux.do 上,有开发者用户发布对比观察,指出 ChatGPT 在网页端与苹果 iOS 移动端存在显著的表现差异。该用户在相同的网络环境(同一 IP)下进行对比测试发现,ChatGPT 的网页端回复质量出现了明显的下降,表现出逻辑连贯性差、回答简略等“降智”特征;而相比之下,官方移动端 App 的回复质量依然保持在高水平,并未出现类似的退化现象。这一现象引发了社区关于 OpenAI 模型分发策略的热烈讨论。从技术细节来看,这种差异并非偶然,此前也有用户反映网页端可能会因为高并发或成本控制被切换至较小的模型版本(如 gpt-4o-mini),而移动端 App 可能依然保有访问更完整模型权限。该事件反映出用户对于 AI 服务一致性的关注,尤其是在不同终端平台上体验割裂的问题。
核心观点:网页端与移动端体验差异折射出算力分配的成本博弈,Web端的高负载常触发模型版本隐形降级。
原文链接:Linux.do