近日,技术社区Linux.do上出现了一起关于大模型工具调用能力的实测讨论。一位开发者在尝试使用AI辅助配置软路由SSH的任务中发现,不同模型的执行能力存在显著差异。该开发者使用的DeepSeek V4 Flash模型表现出了较强的任务理解与工具匹配能力,能够自主意识到需要使用SSH工具并成功连接获取数据。相比之下,Grok 4.6模型在该场景下则显得较为被动,未能主动发起工具调用,即使收到开发者的明确提示,仍然表示无法调用工具。这一现象引发了社区对于AI模型“智能体”化进程的关注,开发者不仅对模型间的性能落差感到疑惑,更探讨了如何有效验证或检索一个模型是否具备特定工具使用权限与能力的方法。该案例通过实际场景揭示了当前大模型在从“对话”向“执行”转型过程中的技术分化。
事件分析
核心观点:工具调用能力正成为大模型分水岭,实战表现往往比通用跑分更能衡量AI在自动化运维领域的真实生产力。
原文链接:Linux.do

评论前必须登录!
立即登录 注册