别低估 Gemini 3.1 Pro:文本改写与响应速度的实测优势
本文通过实际应用场景,对比了多个主流大模型在文本改写任务中的...
本文通过实际应用场景,对比了多个主流大模型在文本改写任务中的...
这篇文章反驳了AI领域常见的“S型曲线”论调,即认为AI的指...

过去一周,AI Agent 圈一口气出了五个"记忆"相关开源...

5 月 9 日到 15 日这一周,大模型这边没什么"平静"可...
网易有道旗下“有道智云AI开放平台”近期推出推广福利,以降低...
GGUF格式因将模型权重、词表、聊天模板及采样参数封装于“单...
近期科技社区热议,许多用户为了通过App Store订阅Ch...
针对大语言模型在“文本编辑”而非“从头生成”场景的应用,研究...

作者:toy 先把两个词分清楚:Context 和 Cont...

这篇文章讲的是一个很容易被低估、但几乎所有 Agent 产品都会撞上的问题:上下文管理。Sally-Ann Delucia 这场分享的价值很直接,她没有泛泛谈“长上下文很重要”,直接把团队在真实产品里踩过的坑讲清楚了,尤其是为什么截断不行、为什么总结也不稳,以及最后为什么留下来的是一套更克制的 context + me

很多人现在一提 eval,脑子里冒出来的还是老三样:题库、benchmark、离线跑分、回归测试。这个思路在过去不是错的。问题是,今天的 agent 系统已经越来越不像“一个发布后基本不动的程序”了。它会接工具、会吃上下文、会随着用户习惯漂移,甚至连 harness 自己都可能被改写。你还拿一套静态题库去盯它,基本等于
一位开发者在社区反馈,长期使用 OpenAI 的 Codex...