DeepSeek正式发布了代号为`deepseek-v4-flash-vision-exp`的多模态视觉模型,标志着其API能力从纯文本拓展至图文理解领域。该模型不仅能看图说话、识别文字,还能分析图表,支持JPEG、PNG、GIF及WebP等主流格式。在技术接入层面,DeepSeek提供了极高的灵活性,支持Base64内联编码、公网URL链接以及Files API文件引用三种输入方式,且完全兼容OpenAI标准的Chat Completions格式和Anthropic的Messages结构,极大降低了开发者的迁移门槛。针对大文件处理,Files API允许上传最大64MiB的单张图片,且在复用场景下能有效节省流量。文档还详细规定了API调用限制:请求体上限为48MiB,外部图片不超过32MiB,单次请求最多支持600张图片,且在处理高分辨率图像时采用了缩放策略,将像素统一至800×800左右,锁定每张图片最高384个Token的计费上限。此外,该模型还集成于Responses API中,支持在工具调用输出环节处理图像,适配更复杂的自动化工作流。
事件分析
核心观点:DeepSeek以极致兼容性和低Token成本切入多模态赛道,有望凭借价格优势加速视觉模型在通用API场景的普及。
原文链接:Hacker News





评论前必须登录!
立即登录 注册