Linum 联合创始人发布了关于其下一代开源权重生成视频模型 Linum v3 的技术博客,深入探讨了数据过滤与再平衡策略对模型训练的决定性作用。文章指出,尽管模型架构(如 Transformer + Flow Matching)趋于稳定,但数据质量的提升是性能突破的关键。团队回顾了从 2024 年依赖 CPU 传统计算机视觉算法(如 PySceneDetect、EAST OCR),到 2025 年转向 GPU 加速的神经网络(如 PaddleOCR、AutoShot)及微调大模型(如 Qwen-2-VL)的演进历程。他们详细阐述了如何利用 H.264 运动向量过滤“难以描述”的视频片段,以及如何通过 Haar 级联降低“对话大头照”视频的过拟合风险。最关键的技术升级发生在 2025 年底,团队采用了 DeepSeek R1 论文中提到的“带可验证奖励的强化学习”(RLVR)技术,利用 Qwen-2.5-VL-3B 模型进行精细的美学评分过滤,取代了传统的监督微调(SFT),实现了更高的筛选精度。通过这套流程,他们将约 150 亿张图片和 10 亿段视频筛选至仅 2.5 亿张图片和 5000 万段高质量视频,显著提升了模型对物理规律和提示词的遵循能力。
事件分析
本文展示了生成式 AI 领域从“暴力堆算力”向“精细化数据工程”转型的典型路径。技术层面的核心看点在于验证了 RLVR(强化学习)不仅在数学和代码推理领域有效,在基于主观标准的审美评分等视觉任务中也能超越传统的 SFT 方法。这标志着模型训练正从“尽可能多吃数据”转向“只吃高质量数据”,并在数据清洗环节引入了大模型级别的智能。产业上,这预示着未来 AI 团队的核心竞争力将不仅仅在于算法架构,更在于构建自动化、可迭代的高质量数据管线。DeepSeek 的技术溢出效应明显,其提出的 RLVR 范式正被快速应用到各类垂直场景的模型微调中。
核心观点:架构红利见顶,利用 RLVR 等技术对百亿级数据做精细化清洗,是提升视频模型智商的必经之路。
原文链接:Hacker News