陈熙@多伦多大学 - 条条电路通罗马:探索大模型机制可解释性的内蕴多样性

MLNLP学术Talk是由 MLNLP社区 和 中国中文信息学会青年工作委员会 联合举办的学术交流活动,旨在邀请一线青年学者分享最前沿的技术,期待最精彩的思想火花碰撞。
本期MLNLP学术Talk邀请了多伦多大学陈熙在2026年8月8日9:00-10:00为我们带来“条条电路通罗马:探索大模型机制可解释性的内蕴多样性“的主题报告。详细信息如下:

本次活动组织者:王奕辰、蒋官语、张宸源、涂耿、姚云志。
战略合作伙伴:腾讯
讲者简介

陈熙,本科毕业于多伦多大学,获计算机科学与数学双专业荣誉理学学士学位。本科期间师从 Gerald Penn 教授。将于2026年9月入学香港中文大学(深圳),师从杜梦楠教授攻读人工智能方向的博士学位。主要研究方向为大语言模型机制可解释性、可解释与可信人工智能,重点关注如何从模型内部计算结构出发,获得更加精确、完整且可靠的机制解释,并进一步利用这些机制层面的洞见提升人工智能系统的可信度。
陈熙曾参与大语言模型 sheaf 发现方法 DiscoGP 的工作,围绕计算图联合剪枝、灵活粒度的机制发现、组合式电路构建及替代机制分析开展工作,相关成果发表于 EMNLP 2025。此后,他作为共同第一作者开展“All Circuits Lead to Rome”研究,系统考察大语言模型内部机制是否具有唯一性,提出重叠感知的 sheaf 发现框架 OASR,揭示同一模型能力能够由多组结构差异显著、但功能等价的内部机制分别实现。该成果被 ICML 2026 接收。邮箱:tonyxichen@tonyxichen.com
报告摘要
随着大语言模型能力不断增强,理解模型内部如何完成推理、语言理解与知识调用,已经成为提升人工智能透明度、可靠性与安全性的关键问题。机制可解释性研究试图将大模型内部复杂的计算过程还原为由注意力头、MLP 模块及其连接组成的计算电路。然而,现有研究通常隐含地假设:对于某一种模型能力,应当存在一个相对唯一、稀疏且不可替代的内部机制。基于这一假设,许多电路发现方法将目标设定为寻找唯一支撑特定任务或模型能力的计算子图。
本次报告将围绕大语言模型的电路与 sheaf 发现展开。首先,报告将介绍 DiscoGP 所提出的 sheaf 发现框架。与一般意义上仅要求因果相关的 circuit 不同,sheaf 还要求被发现的计算子图能够在其余连接被移除或进行零消融后,独立维持模型的任务能力。报告将结合讲者参与的 DiscoGP 相关研究,介绍如何通过计算图联合剪枝与灵活粒度的结构建模,更精确地定位模型中的功能计算路径,并讨论组合式机制构建与替代电路发现等问题。
在此基础上,报告将重点介绍 ICML 2026 工作“All Circuits Lead to Rome”。该研究重新审视了“一个任务对应一个内部机制”的功能各向异性假说,提出重叠感知的 sheaf 发现框架 OASR,在保证任务性能、稀疏性与功能完备性的同时,主动寻找与已有 sheaf 结构尽可能不同的替代机制。实验表明,在间接宾语识别(Indirect Object Identification, IOI)、语法判断及代码注释等多类任务上,同一个模型内可以稳定发现多组结构重叠度极低、却具有相近任务性能的机制解释;在 IOI 任务中,两组均达到 100% 准确率的 sheaf,其边级交并比仅为 4.1%。随着发现的机制数量增加,不同机制的并集持续扩大,而它们的共同交集反而不断缩小。
报告还将讨论这一现象如何跨越 DiscoGP、ACDC、EAP 与 Edge Pruning 等不同电路发现方法而普遍存在,以及为何即便一个仅包含三条边的超稀疏 sheaf,也不能被简单理解为模型完成任务时唯一且不可替代的“核心机制”。这些结果表明,电路发现方法得到的并非某个任务唯一的真实机制,而更可能是一个由大量功能等价、部分冗余且可以相互替代的机制所构成的解释空间中的一个成员。
最后,报告将探讨这一发现对可信人工智能研究的意义。更加精确的机制解释,不仅需要发现能够支撑模型行为的计算机制,更需要理解不同机制之间的等价性、替代性、稳定性及其适用边界。通过从单一电路走向机制等价类与分布式机制的视角,我们有望更加准确地理解模型内部计算过程,并利用这些机制层面的洞见,为模型诊断、风险识别、行为干预及可信人工智能的发展提供更加可靠的理论基础。
主持人介绍

姚云志,浙江大学博士生。师从陈华钧教授与张宁豫教授。主要研究领域为知识增强、语言模型可解释、知识编辑,在Nature Machine Intelligence,NeurIPS、ACL、EMNLP、SIGIR等顶级会议与期刊发表论文。个人主页:https://yyzcowtodd.cn/
直播平台
视频号
B站


关于我们
