共 444 篇文章

标签:AI开发 第2页

Harnesses 让 AI Agent 变得可靠-IT资源栈

Harnesses 让 AI Agent 变得可靠

软件开发里,大家最熟悉的词可能还是 agent。 但最近两年,另一个词开始频繁冒出来:harness。 这个词不好翻。按字面,它是“安全带”或者“束具”。不过放到 AI 工程里,我觉得它更像一层“驯化外壳”——不是替代模型,而是把一个不稳定、不可预测、还经常会撒谎的模型,拴到一个稳定、可验证、可以控的运行环境上。 这篇

Arize 怎么解决 Agent 的上下文管理:系统为什么会被 Context 拖垮-IT资源栈

Arize 怎么解决 Agent 的上下文管理:系统为什么会被 Context 拖垮

这篇文章讲的是一个很容易被低估、但几乎所有 Agent 产品都会撞上的问题:上下文管理。Sally-Ann Delucia 这场分享的价值很直接,她没有泛泛谈“长上下文很重要”,直接把团队在真实产品里踩过的坑讲清楚了,尤其是为什么截断不行、为什么总结也不稳,以及最后为什么留下来的是一套更克制的 context + me

从静态 benchmark 到活的 eval:Vincent Koc 这场分享,真正戳中的不是评测,而是 agent 软件的变形速度-IT资源栈

从静态 benchmark 到活的 eval:Vincent Koc 这场分享,真正戳中的不是评测,而是 agent 软件的变形速度

很多人现在一提 eval,脑子里冒出来的还是老三样:题库、benchmark、离线跑分、回归测试。这个思路在过去不是错的。问题是,今天的 agent 系统已经越来越不像“一个发布后基本不动的程序”了。它会接工具、会吃上下文、会随着用户习惯漂移,甚至连 harness 自己都可能被改写。你还拿一套静态题库去盯它,基本等于