Meta @Scale 2026 全景重构:当数百万智能体成为系统核心主体
Keynote at AI & Data @Scale 2026
Barak Yagour, VP of Engineering at Meta
https://www.youtube.com/watch?v=L0BSZb7ujC8
目录
一、 引言:系统级基础设施的范式转变 二、 智能体作为基础设施核心主体:承载机器做工的系统重构 三、 数据与存储层进化:打破信任边界与规模瓶颈 四、 推荐系统终极演进:从协同过滤走向意图推理 五、 结语:智能体与系统创新的自增强飞轮
一、 引言:系统级基础设施的范式转变
核心观点:AI 行业的创新瓶颈已经从纯粹的算法设计转移到了系统级基础设施。整个行业正在经历从单纯堆叠算力向全栈软硬协同设计的范式转变。
每当你来到 @Scale 大会,必然会期待听到属于超大规模架构的惊人数字。在过去的十年里,我们每年都在这里探讨如何构建服务全球数十亿人的超大规模系统。今天我们依然会讨论这些,但驱动力与挑战已经发生了根本改变。
当下的改变不仅体现在算力需求的激增上。行业内数据中心的建设速度和规模前所未有,为了填补工程人才缺口,Meta 启动了 1.15 亿美元的初始投资建立“美国劳动力人才学院”(America's Workforce Academy),专门培养未来的 AI 基础设施人才。
更深层次的剧变发生在工程和产品内部。在代码端,由 AI 生成的代码比例屡创新高,智能体(Agentic)的 Token 消耗量呈现指数级增长。而在应用端,每天有 35 亿人与 Meta 的产品互动,支撑这一规模下的底层机器、算力集群、数据合规与系统架构,其复杂性呈现几何级上升。
过去,我们所有的核心产品循环——从用户交互、数据生成、推荐打分,到模型训练与产品决策——都是由工程师团队手工设计和运行的。而今天,智能体不再只是辅助性的 Copilot,它们正从会话级副驾驶向全生命周期自治演进。它们能够独立生成大块代码,精通数据管理、分析报告乃至机器学习实验。
我们正在迈入一个全新的工程范式:人类工程师正在从参与回路执行(In the loop)全面转变为在回路之上实施监督(Over the loop)。
二、 智能体作为基础设施核心主体:承载机器做工的系统重构
核心观点:智能体已成为基础设施的核心主体与主力负载来源,其无休止的请求模式正在引发容量、身份与构建速度的三重系统性失效,逼迫底层操作系统与工程架构全面重构。

互联网正在经历流量结构的逆转:去年,自动化流量(Automated Traffic)占比首次超过人类流量,达到 51%,且其增速是人类流量的 8 倍。在 Meta 内部,同样的逆转也在发生——智能体正成为基础设施最核心的资源消耗者。
过去二十年,我们所有的基础设施都是针对人类请求模式进行优化的:基于 Session、行为可预测、且受限于人类自然的生理极限。但智能体不需要休息,当它们成规模运行时,现有的三大系统层面会瞬间面临挑战:
容量(Capacity)失效:以前一名工程师代表一个负载单元。现在一名工程师可以启动数十甚至数百个智能体,每个智能体还会生成子智能体,千人规模的团队瞬间就能在夜间产生数十万级别的用户负载。
身份(Identity)失效:智能体没有员工卡,不是传统的 RPC 服务,也不是离线 Batch 作业。它拥有自主决策权,原有的静态 IAM 权限体系彻底失效。
速度(Velocity)失效:GitHub Copilot 已经编写了大量的代码,智能体能在几秒钟内完成代码生成,但 CI/CD 的构建、测试与部署流水线不会因为作者是机器而自动加速。
为了让基础设施承载机器做工的负载,我们在底层内核、自动化工程与多智能体编排上进行了彻底重构:

内核级调度(
sched_ext):在系统最底层,为了解决通用 EEVDF 调度器在广告业务集群(Ad Fleet)中带来的尾部延迟恶化,我们基于 BPF 的sched_ext框架对 CPU 进行软划分与定制化调度,极大提升了 L3 缓存本地性并消除了不必要的 DRAM 访问。这一改动使广告检索阶段的 p99 尾部延迟降低了 28.2%,全车队节省了 3.2 MW 功耗,并在相同算力下提升了 1.1% 的广告检索与打分吞吐。

机器学习自治引擎(REA):针对动辄运行数天的 ML 实验,我们构建了基于 Confucius 框架的 Ranking Engineer Agent(REA)。它设计了 休眠与唤醒机制(Hibernate-and-wake):启动训练后自动休眠释放资源,任务结束时唤醒复原。在首批上线的 6 个模型中,REA 协助实现了模型准确率翻倍,工程交付产能爆发式增长了 5 倍。
多智能体编排生态:包括支持周级复杂项目自治决策的 Clawtown 框架、探索智能体社交与协同网络的 Maltbook,以及协助高管进行战略推演与实时决策的 Loop 系统。
三、 数据与存储层进化:打破信任边界与规模瓶颈
核心观点:数据开放共享带来了查询量的爆发,必须通过 DataVM 容器建立安全信任边界,并通过彻底剥离特征的序列存储规范化,突破物理存储与算力资源紧缺问题。
今年 2 月 Meta 上线了创建智能体数据应用(Agentic Data Apps)的能力。在短短 3 个月内,公司内部 63% 的新看板均由数据应用生成,底层数据仓库迎来了 30 倍的查询量暴增。
然而,传统的数据提取依赖领域专家进行数据清洗、合规审计与质量把关。当人类退居幕后,缺乏上下文的智能体或使用者极易引入数据泄露与决策风险。写错的代码会抛出异常,而错位的数据却会默默误导高管做出错误的决策。

为此,我们重构了全新的 AI Data Stack 架构:
DataVM 隔离沙箱:为了应对智能体的“不确定性”与提示词注入风险,我们推出了 DataVM 技术。这是一个轻量、无网络的隔离容器,智能体执行 SQL 或脚本时仅在 DataVM 中运行。结合属性动态访问控制(ABAC)进行即时最小权限授予,并对数据链路进行闭环追溯。
隔离域加密(Isolation Domains):对于极度敏感的数据,借用端到端加密机制,每个用户在云端拥有唯一的域密钥(Domain Key),无论是中间轨迹还是生成的报告均实现闭环加密,彻底杜绝凭证泄露。
存储引擎规范化(Data Normalization):面对长行为序列训练导致的特征体积百倍膨胀,传统的冗余单行存储极度消耗算力与存储空间。我们将特征从训练样本中彻底剥离,建立独立的高性能用户序列存储库(ZippyDB),原始表仅保留指针,训练前动态 Join 还原。同时重构 RocksDB 支持 原生多路扫描(Multi-scan)以实现 IO 合并,并支持由 Spark 直接生成 SSTable 注入,彻底释放闪存介质与硬件吞吐上限。
四、 推荐系统终极演进:从协同过滤走向意图推理
核心观点:推荐算法正经历二十年来最深刻的范式转变:从基于模式匹配的协同过滤,走向基于 LLM 的深度意图推理,并衍生出“索引即模型”的极简软硬协同架构。
过去的二十年里,推荐系统的核心逻辑始终是“观察行为—发现模式—预测下一步”。这本质上是极其精密的模式匹配(Pattern Matching)。
大语言模型(LLM)彻底打破了这一教条。推荐系统第一次不再只是关联信号,而是真正理解和推理用户的真实意图。调查显示,42% 的 Instagram 用户希望主动掌控和指挥算法,而不仅仅是调整偏好设置。
这促使我们对推荐引擎进行深度重构:

SilverTorch(索引即模型 / Index as Model):我们彻底抛弃了过去由 ANN 检索、倒排过滤与多任务打分拆分而成的复杂微服务网格。在 SilverTorch 架构下,整个检索与重排逻辑被融合成一个纯 PyTorch 神经网络(作为原生的
nn.Module)。 我们设计了适配 GPU 架构的 Bloom Index Filter 进行位运算过滤,并结合 fused Int8 向量相似度检索。由于数据全程在 GPU 显存内流转,无跨网络跳跃,相比 Faiss-CPU 实现了 23.7 倍的吞吐量提升,TCO 效率提高了 20.9 倍。算法掌控(TYA)与意图推理(TTR):底层通过大模型将用户历史互动沉淀为层次化的 Biography(用户画像记忆系统)。在 Think-Then-Recommend(TTR) 架构下,第一阶段(Thinking)利用大模型将用户模糊意图(如“我想变得更健康”)拆解为运动、饮食等子目标;第二阶段(Recommend)结合 Biography 进行针对性内容推荐,实现真正对话式、可推理的个性化体验。
五、 结语:智能体与系统创新的自增强飞轮
核心观点:智能体、数据基础设施与意图推理推荐系统并不是切块存在的创新,三者交织构成了一个自增强的系统级工程飞轮。
回顾我们的核心产品循环:用户、产品、数据、推荐。 这是一个服务全球 35 亿人的超大规模飞轮。
智能体使数据更容易被消费与挖掘;
实时与规范化的数据架构让深度的意图推理成为可能;
深度意图推理产生的新需求,又反过来推动智能体与底层数据基础设施向更高维度进化。
这绝非线性的渐进式改良,而是一个互为加速器的生态飞轮。十年前,@Scale 大会的主题是如何为全球十亿人口构建超大规模系统;而今天,我们的课题是当这些系统需要同时服务数十亿人类和数百万个超级智能体时,我们该如何重构 IT 基础设施底座。
更多交流,可加本人微信
(请附中文姓名/公司/关注领域)
