DeepSeek API 近日发布重要更新,正式上线了一款名为“V4-Flash-Vision-Exp”的实验性多模态视觉理解模型,标志着该平台在文本处理能力之外,正式开启视觉理解 API 服务。根据官方文档变更记录,此次更新共涉及新增 1 项、更新 3 项内容。核心看点在于用户现在可以通过设置 `model=’deepseek-v4-flash-vision-exp’` 参数来调用该模型的全新视觉感知能力。虽然该模型目前标记为实验性质,但其上线意味着 DeepSeek 正在积极完善其多模态技术栈,试图追赶业界主流趋势。除模型发布外,DeepSeek 还同步更新了官方提示库与模型价格页。提示库的更新预计将为开发者提供针对视觉任务的优化模板,而价格页的更新则明确了新模型的计费标准,便于开发者进行成本核算。此次文档更新显示出 DeepSeek 生态系统正在从单一的代码或文本推理向更广泛的图文交互方向演进,为开发下一代具备视觉能力的 AI 应用提供了基础设施支持。
事件分析
DeepSeek 此次上线视觉理解模型,是其技术路线从纯语言模型向原生多模态演进的重要信号。此前 DeepSeek 主要以强大的代码生成和逻辑推理能力著称,但在视觉处理领域存在短板。推出“Flash”系列视觉模型,显示出其意图在保持轻量化、低延迟优势的同时,补齐图像感知能力,这通常是构建具备物理世界交互能力的 AI Agent 的必经之路。该模型目前定位于“Exp”(实验性),表明其可能仍在进行广泛测试,旨在通过 API 调用收集多样化的真实世界数据以优化鲁棒性。从产业角度看,随着 OpenAI GPT-4o 和 Google Gemini 等竞品多模态能力的成熟,DeepSeek 此举意在留住寻求低成本、高性能视觉解决方案的开发者,丰富其应用生态的多样性。
核心观点:DeepSeek 通过实验性 API 补齐视觉感知短板,加速向全能型 AI 生态演进。
原文链接:Linux.do