DeepSeek 近日悄然为旗下 Flash 系列 API 增加了视觉模式功能,引发了开发者社区的广泛关注。据 V2EX 用户披露,目前可用的测试模型名称为 deepseek-v4-flash-vision-exp,标志着 DeepSeek 正式开始向多模态领域扩张,继文本处理能力后补齐视觉短板。此次更新主要针对 API 接口层面的支持,允许开发者在调用时切换至该视觉模型进行测试。从社区反馈来看,这一功能虽然已上线,但目前仍处于实验阶段。有开发者指出,在对话中插入图片后,后续上下文缓存机制可能出现失效(归零)的情况,这可能对依赖长上下文缓存的应用成本产生影响。在实际识别效果方面,首批测试者反馈该模型的图像理解准确率目前表现不佳,甚至出现识别错误的情况。这可能是由于模型尚处于早期实验版本,或是提示词工程优化不足所致。总体而言,DeepSeek Vision 的上线意味着其大模型生态正在从纯文本向图文理解演进,但距离成熟商业化应用仍需经过多轮迭代与性能优化。
事件分析
核心观点:DeepSeek切入多模态赛道,低成本视觉能力有望成为AI应用普及的新变量。
原文链接:V2EX 分享发现





评论前必须登录!
立即登录 注册