上海交通大学Endless Frontier Lab研究团队推出了新一代大语言模型BigBang-V1。该模型基于Qwen 3.6(35B-A3B)架构,创新性地采用了对抗式自进化合成数据框架,突破了传统训练中对人类专家设计任务的依赖。其核心机制由生成器智能体和评判器智能体组成:前者负责持续提出并求解难度递增的科学与技术问题,后者则从正确性、难度、可扩展性及多样性四个维度评估生成内容,并以真实前沿研究任务校准数据分布。通过这一迭代博弈过程,团队仅用约1万条高质量样本便完成了高效后训练。性能测试方面,BigBang-V1在涵盖长程搜索、软件工程、科学研究及AI研究的8项基准测试中,均取得了35B规模模型的最高分。特别是在科学研究方向,其在FrontierScience Research、Humanity’s Last Exam、BioMysteryBench-HD及PaperBench上的得分,均超越了参数量达1.6万亿的DeepSeek V4 Pro Preview。在代码能力方面,SWE-Bench Pro得分54.2,位居同规模模型首位。
事件分析
💡 核心观点:对抗式自进化合成数据让AI实现“自我越狱”,证明了高质量算法与数据博弈优于暴力算力堆叠。
原文链接:Linux.do





