上海交通大学发布自进化大模型BigBang-V1,36B参数媲美千亿级巨模型
转载自:linux.do/t/topic/2721309
上海交通大学旗下Endless Frontier Lab研究团队近日推出新一代大语言模型BigBang-V1,凭借独创的对抗式自进化合成数据框架,仅用约1万条高质量训练样本,便实现了远超同规模模型的综合性能表现。
传统大模型训练高度依赖人类专家设计的训练任务,随着模型能力逼近人类水平,这一路径正面临明显瓶颈。BigBang团队提出全新思路,让模型在知识边界处自主生成、自主验证任务,从而突破人类知识上限的束缚。
BigBang-V1基于Qwen 3.6(35B-A3B)进行高效后训练,其核心框架由两大组件构成。其一为生成器智能体,负责持续提出并求解难度递增的科学与技术问题;其二为评判器智能体,从正确性、难度、可扩展性、多样性四个维度评估生成内容,并以真实前沿研究任务校准合成数据分布。通过生成器与评判器的迭代博弈,框架最终构建了跨多领域约1万条高难度后训练样本,以极低的数据成本实现了显著的性能飞跃。
在涵盖长程搜索、软件工程、科学研究、AI研究的8项代表性基准测试中,BigBang-V1在所有8项测试中均取得35B规模模型的最高分。
在科学研究方向,BigBang-V1于FrontierScience Research得分46.2,Humanity’s Last Exam得分50.3,BioMysteryBench-HD得分15.7,PaperBench(Code-Dev)得分53.6,上述四项均超越参数量达1.6万亿的DeepSeek V4 Pro Preview。
在代码能力方面,SWE-Bench Pro得分54.2,位居35B模型首位。在长程搜索方面,BrowseComp得分76.5,同样领跑同规模模型。

本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu