DeepSeek推出Flash视觉模式API,多模态能力开启测试

DeepSeek 近日悄然为旗下 Flash 系列 API 增加了视觉模式功能,引发了开发者社区的广泛关注。据 V2EX 用户披露,目前可用的测试模型名称为 deepseek-v4-flash-vision-exp,标志着 DeepSeek 正式开始向多模态领域扩张,继文本处理能力后补齐视觉短板。此次更新主要针对 API 接口层面的支持,允许开发者在调用时切换至该视觉模型进行测试。从社区反馈来看,这一功能虽然已上线,但目前仍处于实验阶段。有开发者指出,在对话中插入图片后,后续上下文缓存机制可能出现失效(归零)的情况,这可能对依赖长上下文缓存的应用成本产生影响。在实际识别效果方面,首批测试者反馈该模型的图像理解准确率目前表现不佳,甚至出现识别错误的情况。这可能是由于模型尚处于早期实验版本,或是提示词工程优化不足所致。总体而言,DeepSeek Vision 的上线意味着其大模型生态正在从纯文本向图文理解演进,但距离成熟商业化应用仍需经过多轮迭代与性能优化

事件分析

DeepSeek 推出 Flash 版本的视觉模型,意在低成本、高效率的多模态应用场景中抢占市场。不同于主力推理模型,Flash 系列通常定位为快速响应与低成本调用,此次加入视觉能力,旨在解决目前多模态 API 普遍价格较高的问题,为开发者提供更经济的选择。关于“发送图片导致缓存归零”的反馈,若属实,这暴露了多模态上下文管理的工程难点。在纯文本模型中,KV Cache 能有效降低推理成本,但高分辨率的图像 token 占用巨大,且压缩技术复杂,导致现有缓存策略在引入图像后可能失效。初期识别准确率不高属于预期范围内,作为 -exp 后缀的实验性模型,其核心目的是收集数据以优化视觉 Encoder 与 Language Model 的对齐。此举表明 DeepSeek 正试图构建对标 GPT-4o 的全栈能力,补齐视觉短板是其在模型军备竞赛中保持竞争力的关键一步。

核心观点:DeepSeek切入多模态赛道,低成本视觉能力有望成为AI应用普及的新变量。

原文链接:V2EX 分享发现

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册