Black Forest Labs 正式发布了其最新的多模态基础模型 FLUX 3,并已开启 Early Access(早期访问)。FLUX 3 采用了全新的统一架构,能够在单一模型中联合学习图像、视频和音频数据,旨在构建对物理世界的深度理解。该模型的设计理念在于,单一模态无法提供对现实的完整描述,每种传感器在捕捉信息时都会丢失部分数据。因此,FLUX 3 致力于通过整合不同维度的信息来还原世界的真实面貌:图像帮助模型捕捉特定时刻下的空间结构与物体关系;视频引入了时间维度,揭示了物体运动的动态规律及物理法则;音频则揭示了机械现象与声学之间的因果关系,这是仅凭视觉无法察觉的;而自然语言则将这些感知与人类的意图、目标及抽象指令关联起来。通过这种跨模态的联合训练,FLUX 3 不仅学习各个模态,更是在学习“世界的表征”——即物体如何组合、事物如何运动以及事件如何发声,从而在生成任务中实现更高的逻辑一致性和真实感。
事件分析
💡 核心观点:FLUX 3 通过统一架构实现视听联合学习,标志着生成式 AI 从追求单一模态画质向构建物理世界模型的跨越。
原文链接:Hacker News





