共 468 篇文章

标签:AI应用 第4页

从静态 benchmark 到活的 eval:Vincent Koc 这场分享,真正戳中的不是评测,而是 agent 软件的变形速度-IT资源栈

从静态 benchmark 到活的 eval:Vincent Koc 这场分享,真正戳中的不是评测,而是 agent 软件的变形速度

很多人现在一提 eval,脑子里冒出来的还是老三样:题库、benchmark、离线跑分、回归测试。这个思路在过去不是错的。问题是,今天的 agent 系统已经越来越不像“一个发布后基本不动的程序”了。它会接工具、会吃上下文、会随着用户习惯漂移,甚至连 harness 自己都可能被改写。你还拿一套静态题库去盯它,基本等于

把 OpenClaw Coding Agent 塞进产品里,难点其实在接口设计-IT资源栈

把 OpenClaw Coding Agent 塞进产品里,难点其实在接口设计

这篇文章拆的是一个很具体、也很快会变成共性的问题:当团队开始把 OpenClaw / Pi 这类 coding agent 往真实产品里塞时,真正先卡住你的,通常不是模型能力,而是 CRM、ERP、邮件、session 和 CLI 接口有没有被整理成 Agent 也能顺手工作的系统。 这场分享我挺喜欢,因为它没继续停在