DeepSeek正式发布了代号为`deepseek-v4-flash-vision-exp`的多模态视觉模型,标志着其API能力从纯文本拓展至图文理解领域。该模型不仅能看图说话、识别文字,还能分析图表,支持JPEG、PNG、GIF及WebP等主流格式。在技术接入层面,DeepSeek提供了极高的灵活性,支持Base64内联编码、公网URL链接以及Files API文件引用三种输入方式,且完全兼容OpenAI标准的Chat Completions格式和Anthropic的Messages结构,极大降低了开发者的迁移门槛。针对大文件处理,Files API允许上传最大64MiB的单张图片,且在复用场景下能有效节省流量。文档还详细规定了API调用限制:请求体上限为48MiB,外部图片不超过32MiB,单次请求最多支持600张图片,且在处理高分辨率图像时采用了缩放策略,将像素统一至800×800左右,锁定每张图片最高384个Token的计费上限。此外,该模型还集成于Responses API中,支持在工具调用输出环节处理图像,适配更复杂的自动化工作流。
事件分析
此次更新不仅是模型能力的补全,更是DeepSeek构建生态壁垒的关键一步。在OpenAI和Anthropic主导的多模态API市场中,DeepSeek通过协议兼容性策略,有效吸纳了存量开发者,使其能以极低成本无缝切换至DeepSeek的高性能架构。技术上,强制图像缩放和Token封顶的设计,体现了其优化推理成本、提升响应速度的工程考量,避免了因分辨率过高导致的资源浪费。同时,支持Files API和Responses API的结合,意味着该模型已具备处理企业级文档流和复杂Agent工作流的潜力,不再局限于简单的问答,这为DeepSeek在RAG(检索增强生成)和自动化办公领域的应用奠定了基础。
核心观点:DeepSeek以极致兼容性和低Token成本切入多模态赛道,有望凭借价格优势加速视觉模型在通用API场景的普及。
原文链接:Hacker News