上海交大发布BigBang-V1:对抗自进化合成数据,36B参数性能媲美万亿级模型

上海交通大学Endless Frontier Lab研究团队推出了新一代大语言模型BigBang-V1。该模型基于Qwen 3.6(35B-A3B)架构,创新性地采用了对抗式自进化合成数据框架,突破了传统训练中对人类专家设计任务的依赖。其核心机制由生成器智能体和评判器智能体组成:前者负责持续提出并求解难度递增的科学与技术问题,后者则从正确性、难度、可扩展性及多样性四个维度评估生成内容,并以真实前沿研究任务校准数据分布。通过这一迭代博弈过程,团队仅用约1万条高质量样本便完成了高效后训练。性能测试方面,BigBang-V1在涵盖长程搜索、软件工程、科学研究及AI研究的8项基准测试中,均取得了35B规模模型的最高分。特别是在科学研究方向,其在FrontierScience Research、Humanity’s Last Exam、BioMysteryBench-HD及PaperBench上的得分,均超越了参数量达1.6万亿的DeepSeek V4 Pro Preview。在代码能力方面,SWE-Bench Pro得分54.2,位居同规模模型首位。

事件分析

BigBang-V1的发布展示了“智能体+合成数据”在打破模型能力瓶颈方面的巨大潜力。通过让模型自主生成并验证超越人类专家水平的难题,该研究为解决高质量训练数据短缺提供了一条可行路径。这种“自我博弈”的训练范式使得36B参数的中小模型在特定复杂任务上反超万亿级巨量模型,证明了在当前阶段,针对特定领域的数据质量与训练策略优化,其边际收益可能远高于单纯的参数规模扩张。这对未来AI在科研辅助及代码生成领域的垂直应用具有启发意义。

💡 核心观点:对抗式自进化合成数据让AI实现“自我越狱”,证明了高质量算法与数据博弈优于暴力算力堆叠。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册