技术拆解:利用 MCP 协议与 GLM-4V,让纯文本版 DeepSeek 获得视觉能力

近日,有开发者展示了一种创新的技术方案,通过 MCP(Model Context Protocol)协议连接外部视觉模型,成功为纯文本版的 DeepSeek 模型赋予了图片识别与分析能力。该方案的核心机制在于利用 DeepSeek 强大的指令规划能力,让其生成并调度 11 个并发的图像识别请求。由于 GLM-4V-Flash 免费版对输入字符长度有限制,该方案巧妙地将复杂的图像分析任务拆解为文本提取、像素级细节分析、整体布局研判以及 UI 设计评审等多个维度。DeepSeek 在此流程中充当“大脑”角色,负责指挥 GLM-4V-Flash 这一“眼睛”进行观察,并将返回的碎片化信息重新整合,从而实现精准的图像理解。此外,该工作流还引入了 UI 优化的反馈机制:当 DeepSeek 生成用户界面代码时,系统会强制要求其调用 MCP 工具进行视觉审查,根据外部模型的建议进行多轮迭代修改。这一实践证明了基于 MCP 协议的“工具调用”模式,能够有效补强单一模型在感知能力上的短板,为低成本构建多模态智能体提供了极具参考价值的范例。

事件分析

该案例生动展示了 AI 开发中“模型解耦”与“编排”的重要性。技术层面上,开发者没有等待模型本身进化出多模态能力,而是通过提示词工程让 DeepSeek 充当任务分解器,将 11 个细粒度的视觉任务分发至专门的视觉模型执行。这种“以强推理调度强感知”的架构,完美规避了单一模型上下文窗口受限或模态缺失的问题。从产业影响看,MCP 协议正在重塑 AI 应用的开发范式,即通过标准化协议连接专业化模型,而非依赖单一巨量模型解决所有问题。这种“组合拳”模式不仅显著降低了构建复杂 Agent 的成本,也极大地提升了系统的灵活性,预示着未来 AI Agent 将更倾向于模块化组合而非单体升级。

💡 核心观点:单体全能模型不再是唯一解,通过 MCP 协议将推理模型与专业视觉模型解耦编排,将是构建低成本多模态 Agent 的主流趋势。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册