Linum 联合创始人发布了关于其下一代开源权重生成视频模型 Linum v3 的技术博客,深入探讨了数据过滤与再平衡策略对模型训练的决定性作用。文章指出,尽管模型架构(如 Transformer + Flow Matching)趋于稳定,但数据质量的提升是性能突破的关键。团队回顾了从 2024 年依赖 CPU 传统计算机视觉算法(如 PySceneDetect、EAST OCR),到 2025 年转向 GPU 加速的神经网络(如 PaddleOCR、AutoShot)及微调大模型(如 Qwen-2-VL)的演进历程。他们详细阐述了如何利用 H.264 运动向量过滤“难以描述”的视频片段,以及如何通过 Haar 级联降低“对话大头照”视频的过拟合风险。最关键的技术升级发生在 2025 年底,团队采用了 DeepSeek R1 论文中提到的“带可验证奖励的强化学习”(RLVR)技术,利用 Qwen-2.5-VL-3B 模型进行精细的美学评分过滤,取代了传统的监督微调(SFT),实现了更高的筛选精度。通过这套流程,他们将约 150 亿张图片和 10 亿段视频筛选至仅 2.5 亿张图片和 5000 万段高质量视频,显著提升了模型对物理规律和提示词的遵循能力。
事件分析
核心观点:架构红利见顶,利用 RLVR 等技术对百亿级数据做精细化清洗,是提升视频模型智商的必经之路。
原文链接:Hacker News

评论前必须登录!
立即登录 注册