BigBang:把科学前沿变成进化引擎

过去几年,大模型能力增长有一条熟悉的Scaling路径,即更多参数、更多算力、更多数据。然而,当模型逐渐逼近人类专家的极限,新的瓶颈开始浮现:如果任务本身仍然停留在人类会做的范畴,模型还能从哪里获得超越人类的能力?
来自上海交通大学的这支团队给出了答案,他们发布的BigBang-V1模型打破了35B参数量模型的能力边界,在搜索、编程、自动化科研等任务上达到了媲美甚至超过1T参数模型的效果。BigBang 给出的答案是:可验证的前沿任务,一个更容易理解的说法是:科学!
模型:https://huggingface.co/endless-frontier/BigBang-v1
项目主页:https://endlessfrontier.tech/
完整技术报告:https://endlessfrontier.tech/
一、科学:无尽的前沿
《科学:无尽的前沿》是一部深刻影响了美国乃至全球科技发展进程的纲领性文献。它源于1945年,由美国传奇科学家范内瓦·布什(Vannevar Bush)应罗斯福总统之请撰写的一份报告。该报告被誉为美国科学政策的“开山之作”,奠定了二战后美国科学技术的发展。作为一种永无止境的探索,科学承载了人类对世界最诚挚的好奇心,承载了对于社会发展的渴望。在今天,科学又有了一项新的职责:人工智能发展的新路线。

图1:《科学:无尽的前沿》,作者为范内瓦·布什
模型的发展永远依赖于那些对于它来说尚未掌握的知识。不幸的是,当模型已经足以证明数十年无法解决的数学证明,当模型已经可以熟练完成日常办公的任务,我们必须要回答一个问题:未来模型的智力从哪里来?
BigBang 给出的答案是:不要只让模型学习“已有答案”,而要让它持续面对位于知识边界、同时又能够被客观验证的问题。我们把这类问题称为“可验证前沿任务”。“前沿”意味着问题足够难,甚至没有已知最优解;“可验证”意味着候选解可以通过形式化方法、代码执行、仿真、计算工具或领域规则被检查。两者缺一不可:只有前沿、没有验证,训练信号不可信;只有验证、没有难度,能力很快触顶。BigBang 的核心判断是,真正可持续的能力增长,发生在这两者的交叉处——科学。

图2:BigBang整体框架。Generator Agent持续更新数据合成策略并构造任务,Critic Agent执行质量评估和约束检查,经过筛选的合成数据用于后训练BigBang-V1。
二、自提升:从AlphaGo走向AlphaZero
围绕这一判断,上海交通大学的这支团队构建了一套对抗式、自进化的数据合成框架,用于不断针对当前模型的能力边界,构造那些足够难而可验证的科学问题,作为模型训练的养料。Generator Agent 负责提出并求解更难的问题,也可以直接修改、执行和调试数据合成代码;Critic Agent 不只看答案像不像,还会检查正确性、可验证性、难度、可扩展性、多样性和训练价值。低质量候选被拒绝或返工,高价值任务则反过来抬高下一轮生成的难度。这套循环并不只在“合成世界”里自我评分。系统会使用留出的真实研究任务识别模型当前的能力缺口,并校准 Critic 的判断:哪些任务只是看起来复杂,哪些任务真的能提升模型能力。由此形成一个闭环:真实前沿任务指路,Generator 与 Critic 生产并筛选数据,数据训练新模型,新模型再回到真实任务上接受检验。
BigBang-V1 从 Qwen3.6-35B-A3B 演化而来。仅使用约 1 万条后训练样本和 SFT,BigBang-V1 就在 11 个评测中的 10 项超过底座模型,在国外基模公司自己开发的Benchmark上正面击败了它们。
FrontierScience是由 OpenAI 于 2025 年 12 月 16 日推出的一个前沿 AI 基准测试。它被设计用来评估 AI 大模型在物理、化学和生物学领域进行专家级科学推理的能力,其题目全部由顶尖科学家或奥林匹克竞赛奖牌得主设计。在这样高难度的任务上,BigBang-V1最终精度达到了46.2%,超过了Claude Opus4.8的45.2%,DeepSeekV4Pro的40.7%,展现除了其在解决复杂科学任务上的卓越能力;在报告选取的 35B 对照组中,BigBang-V1 在 8 个Benchmark上取得最高报告分数,并达到了匹配DeepSeekV4Pro的效果(1.6T参数,是前者的45倍)。

图3:BigBang-V1在六项代表性评测中的表现。绿色为BigBang-V1,左侧为35B规模模型,右侧为更大规模或闭源模型。在FS-R、HLE、BioMysteryBench-HD和PaperBench等任务上,BigBang-V1超过DeepSeek V4 Pro Preview。
三、从Science走向AI:科学从来不是一个垂域
如果科学只是一个垂直领域,那么这些能力提升理应停留在科研评测中。但 BigBang-V1 的结果恰恰相反:在训练目标之外,它的搜索、编程和机器学习工程能力同样出现了明显增长。
在测试开放网络长程检索能力的 BrowseComp 上,BigBang-V1 从底座模型的 67.9 提升至 76.5,并超过 DeepSeek V4 Flash Preview 的 73.2;在面向真实代码仓库、考验复杂软件工程能力的 SWE-Bench Pro 上,成绩从 43.6 提升至 54.2,同样高于 DeepSeek V4 Flash Preview(284B) 的 52.6。两项结果说明,科学任务中形成的信息检索、证据整合、工具调用和长程规划能力,可以直接迁移到开放网络搜索与真实软件开发场景。由红杉中国(HongShan)推出的 xbench用于评测模型在真实复杂场景上的调研能力,在这个榜单上,BigBang-V1 从 32.6 大幅提升至 58.4,加入专用 Agent Harness 后进一步达到 64.4,超越了DeepSeek V4 Flash Preview(284B)的 52.6。
这意味着,BigBang 从科学任务中学到的并不只是更多科学知识,而是一套可以跨领域复用的问题解决方法:如何搜索证据、提出假设、调用工具、设计验证、发现失败,并据此调整下一步行动。科学在这里不只是 AI 的应用对象,也开始成为训练通用智能的课程体系。
四、BigBang:奇点已现
如果只看 BigBang-V1,它是一款以较小规模进入前沿能力区间的 35B 模型;但如果把视野拉长,真正有价值的是模型背后那台能够持续发现问题、制造任务、验证答案并吸收失败的数据引擎。
模型会迭代,榜单会刷新,参数优势也可能被下一轮 Scaling 迅速追平。但一套能够跟随模型能力共同进化的数据系统,具有完全不同的复利结构:模型越强,越能参与生成和解决更难的问题;更难、更可靠的任务,又会训练出更强的模型。每一轮能力提升,都在为下一轮能力提升创造新的燃料。
这也重新定义了 AI 公司的核心资产。过去,人们关注的是谁拥有更多算力、更多参数和更多数据;下一阶段,更稀缺的或许是谁能比模型更早发现它的能力缺口,谁能持续创造位于前沿的训练任务,又能证明这些任务真的带来了通用能力增长。
1945 年,《科学:无尽的前沿》试图回答的是,一个国家如何通过持续投入基础科学,创造未来几十年的增长。今天,BigBang 提出了一个属于 AI 时代的对应问题:
当科学前沿本身成为模型可以持续利用的训练资源,智能的增长曲线还会有终点吗?
也许 BigBang 还只是这条新曲线上的第一个点,而这条即将陡峭飞跃的曲线,已经开始了它的第一次攀登。

扫描二维码添加小助手微信
关于我们
