近期,在技术社区Linux.do的一则讨论引发了AI界的广泛关注,话题源起于小红书上的一则互动。一位疑似DeepSeek(深度求索)运维人员的员工在回应关于多模态能力的提问时,给出了暗示模型具备视觉感知能力的答复。考虑到DeepSeek现有模型(如V3及R1)主要通过外挂OCR模型来处理图像,而此次回应针对的是“看到我”这一视觉感知诉求,业界推测DeepSeek可能已在下一代模型(暂称V4或相关版本)中实装了原生多模态架构。
原生多模态意味着模型不再依赖外部插件将图片转为文字,而是从训练阶段就融合了视觉与语言信息,能够像人类一样直接理解图像语义、空间关系和逻辑细节。作为近期在开源大模型领域凭借MoE架构和极致推理性能出圈的顶流,DeepSeek若实现这一技术跨越,将标志着其从纯文本推理模型向全感官通用大模型转型。这不仅补齐了其相对于GPT-4o、Claude 3.5 Sonnet等竞品的短板,更为未来在物理世界交互、具身智能及复杂文档理解等领域的应用奠定了基础。
事件分析
从技术架构来看,原生多模态与外挂OCR有着本质区别。外挂方案本质上是将视觉任务降维为文本识别,容易丢失图片中的布局、风格及非文字语义信息;而原生多模态(Native Multimodal)通过在预训练阶段引入图像-文本对齐数据或使用联合编码器,能够让模型直接理解视觉特征,这对于需要复杂视觉逻辑的UI自动化、物理世界交互至关重要。
产业层面,DeepSeek近期凭借R1推理模型的爆火重新定义了开源模型的性能边界,但其在前端交互和应用层仍受限于单一的模态形态。一旦DeepSeek补齐视觉能力,结合其已有的高性价比推理优势,将极大冲击现有的AI Agent(智能体)市场格局。目前,OpenAI和Anthropic已将多模态作为核心壁垒,DeepSeek此举若属实,意味着中国头部大模型厂商在“感知-认知-决策”的技术闭环上已全面对标国际顶尖水平。
产业层面,DeepSeek近期凭借R1推理模型的爆火重新定义了开源模型的性能边界,但其在前端交互和应用层仍受限于单一的模态形态。一旦DeepSeek补齐视觉能力,结合其已有的高性价比推理优势,将极大冲击现有的AI Agent(智能体)市场格局。目前,OpenAI和Anthropic已将多模态作为核心壁垒,DeepSeek此举若属实,意味着中国头部大模型厂商在“感知-认知-决策”的技术闭环上已全面对标国际顶尖水平。
核心观点:DeepSeek若补齐原生多模态短板,将彻底打通从“读图”到“推理”的技术闭环,大幅降低复杂场景下的AI Agent开发成本,进一步重塑全球开源大模型的竞争态势。
原文链接:Linux.do