近日,有开发者展示了一种创新的技术方案,通过 MCP(Model Context Protocol)协议连接外部视觉模型,成功为纯文本版的 DeepSeek 模型赋予了图片识别与分析能力。该方案的核心机制在于利用 DeepSeek 强大的指令规划能力,让其生成并调度 11 个并发的图像识别请求。由于 GLM-4V-Flash 免费版对输入字符长度有限制,该方案巧妙地将复杂的图像分析任务拆解为文本提取、像素级细节分析、整体布局研判以及 UI 设计评审等多个维度。DeepSeek 在此流程中充当“大脑”角色,负责指挥 GLM-4V-Flash 这一“眼睛”进行观察,并将返回的碎片化信息重新整合,从而实现精准的图像理解。此外,该工作流还引入了 UI 优化的反馈机制:当 DeepSeek 生成用户界面代码时,系统会强制要求其调用 MCP 工具进行视觉审查,根据外部模型的建议进行多轮迭代修改。这一实践证明了基于 MCP 协议的“工具调用”模式,能够有效补强单一模型在感知能力上的短板,为低成本构建多模态智能体提供了极具参考价值的范例。
事件分析
💡 核心观点:单体全能模型不再是唯一解,通过 MCP 协议将推理模型与专业视觉模型解耦编排,将是构建低成本多模态 Agent 的主流趋势。
原文链接:Linux.do

评论前必须登录!
立即登录 注册