
Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,并扩展至10,000+可交互训练环境,长输入下TTFT降低60%至80%以上。

Introducing Workflows in Runway Agent. Now you can build, run or edit your node-based workflows through natural language. Workflows unlock high quality outputs at scale.

开放权重模型对于健康的 AI 生态系统至关重要。我们与行业内的其他各方一道,正在规划一条路径,让开放权重模型在保护国家安全的同时,增强美国的竞争力并扩大经济机遇。https://www.microsoft.

百度搭子在近期AI Day上推出多项升级,支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作。桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作,手机端支持云端远程操控。

Google DeepMind 研究副总裁 Benoit Schillings 在 AI Engineer 的这场分享里说了一句很狠的话:代码已经结束了,但还有大量事情要做。本文整理这场演讲,并结合我自己的 AI 编程 / Harness 笔记,讨论为什么未来的瓶颈不再是写代码,而是规格、验证、安全、架构和新型软件语言

本文整理自 BridgeMind 对 Kimi K3 的一次上手测试:它不再只是便宜替代品,而是开始在 UI 设计、全栈应用生成和真实 agentic coding 任务里挑战闭源前沿模型。原视频:https://www.youtube.com/watch?v=MG-uS684uc0 这期视频真正有价值的地方,不是“某

先说结论:提示词工程(Prompt Engineering,...

Vercel 最早解决的问题是帮人把网站发布到互联网上,不用...

2013 年,Garry Tan 是 Y Combinato...

Theo Browne 给自己这半年的状态起了个名字,"AI...

我们自己这几个月往 里塞的东西越来越多,写博客、发飞书消息、...