上海交通大学发布自进化大模型BigBang-V1,36B参数媲美千亿级巨模型

AI摘要
【知识分享】本文介绍上海交大Endless Frontier Lab发布的大语言模型BigBang-V1,采用对抗式自进化合成数据框架,以约1万条高质量样本实现高效后训练。该模型基于Qwen 3.6(35B-A3B),通过生成器与评判器智能体迭代博弈,在8项基准测试中均获35B规模最高分,部分指标超越更大参数模型,展示了低数据成本下的性能突破。

转载自:linux.do/t/topic/2721309
上海交通大学旗下Endless Frontier Lab研究团队近日推出新一代大语言模型BigBang-V1,凭借独创的对抗式自进化合成数据框架,仅用约1万条高质量训练样本,便实现了远超同规模模型的综合性能表现。

传统大模型训练高度依赖人类专家设计的训练任务,随着模型能力逼近人类水平,这一路径正面临明显瓶颈。BigBang团队提出全新思路,让模型在知识边界处自主生成、自主验证任务,从而突破人类知识上限的束缚。

BigBang-V1基于Qwen 3.6(35B-A3B)进行高效后训练,其核心框架由两大组件构成。其一为生成器智能体,负责持续提出并求解难度递增的科学与技术问题;其二为评判器智能体,从正确性、难度、可扩展性、多样性四个维度评估生成内容,并以真实前沿研究任务校准合成数据分布。通过生成器与评判器的迭代博弈,框架最终构建了跨多领域约1万条高难度后训练样本,以极低的数据成本实现了显著的性能飞跃。

在涵盖长程搜索、软件工程、科学研究、AI研究的8项代表性基准测试中,BigBang-V1在所有8项测试中均取得35B规模模型的最高分。

在科学研究方向,BigBang-V1于FrontierScience Research得分46.2,Humanity’s Last Exam得分50.3,BioMysteryBench-HD得分15.7,PaperBench(Code-Dev)得分53.6,上述四项均超越参数量达1.6万亿的DeepSeek V4 Pro Preview。

在代码能力方面,SWE-Bench Pro得分54.2,位居35B模型首位。在长程搜索方面,BrowseComp得分76.5,同样领跑同规模模型。

上海交通大学发布自进化大模型BigBang-V1,36B参数媲美千亿级巨模型

本作品采用《CC 协议》,转载必须注明作者和本文链接
六月的风
Junwind
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!
躺平大叔 @ 躺平社区
文章
267
粉丝
18
喜欢
115
收藏
64
排名:237
访问:4.0 万
私信
所有博文
社区赞助商