同一任务实测国内外 AI:国内模型擅自加配色,Claude 免费额度还原最完美

V2EX 用户分享了一次 AI 使用体验:作者将一个简单任务——把约14张截图按文件名顺序拼接转换为可编辑的 Word 或 PDF 文件——分别提交给多款 AI 工具测试。作者最初使用免费的 workbuddy,因其生成速度较慢,又将相同任务提交给其他常用 AI 进行对比。测试结果显示,国内外模型表现差异明显:作者在提示词中只要求“按文件名顺序,还原成可编辑的 word 或者 pdf 文件”,并未要求美化或重新排版,国外模型基本按原图忠实还原,而国内两款工具都自动默认添加了绿色配色,排版与原图也有不少出入。作者形容国内模型的输出“感觉有很多人工干预过的东西混杂在结果里面”,不是标准化的逻辑输出。更令作者意外的是,其 Claude 账号此前被封,未订阅付费服务,仅凭免费试用额度完成任务,生成的结果却是最完美的。作者总结认为,国内模型“能用”,但在实际工作中不敢将任务直接交给它,担心出现意料之外的输出,这反映出用户对模型指令遵循能力和输出确定性的顾虑。

事件分析

从技术角度看,这一案例指向模型指令遵循能力与产品预设之间的张力。国内模型在用户未提出需求时自动添加配色、重排版面,通常源于产品层的隐藏系统提示词,或对齐训练后的“过度热心”倾向——模型被调优为倾向于展示更多增值输出。而 Claude 表现出的克制恰恰是 Agent 场景的核心能力:严格执行指令、不引入未要求的变更,这直接决定任务能否被放心地端到端委托。对产业而言,随着 AI Agent 落地,输出的可预测性和一致性将比单点效果更受重视,自作主张式的优化会持续消耗用户信任。需要指出的是,该测试样本量极小、任务类型单一,结论仅具参考性,但现象本身与社区长期讨论的国内外模型调优路线差异相互印证,可作为用户侧真实反馈的样本。

核心观点:AI 的可信度不在于做得更多,而在于严格遵循指令;过度热心的隐藏调优正在消耗用户对国产模型的信任。

原文链接:V2EX 分享发现

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册