一位开发者在整理历年岗位数据时,将Workbuddy(搭载DeepSeek-V4.1-Flash)与Codex(搭载GPT-6 Astra轻度思考模式)进行同题对比测试,两者接收完全相同的原始样本和筛选要求。结果显示,Workbuddy几乎一轮即输出结果,并在未被要求的情况下自动生成单文件HTML页面与xlsx表格:页面顶部设有统计数据,附带筛选入口和可滚动的岗位信息列表,结构清晰直观。Codex则经过三轮迭代:第一轮仅输出普通xlsx表格,数据正确但缺乏交互;第二轮生成的HTML配色怪异、信息密度偏低;第三轮以Workbuddy的成品为参考修改后才明显改善,但作者认为仍不及前者。作者指出两侧数据均准确,中间各有小错误,差距主要体现在呈现效果上,根源在于客户端harness调教差异而非模型能力,测试期间未添加任何额外提示词或限制。此外,Workbuddy默认以图文卡片、流程图形式呈现回答,并自动在markdown文件中记录错误、要求与注意点,办公场景适配较好。作者坦言此次对比为单次样本、单一场景,严谨性有限,Codex表现同样出色只是审美不合,Workbuddy在办公交付形态上更胜一筹,并提及该产品每日可领取100积分。
事件分析
核心观点:模型能力趋同后,交付形态与harness调教正取代参数规模,成为AI工具体验分化的决定性变量。
原文链接:Linux.do

评论前必须登录!
立即登录 注册