“开源和闭源的差距,一年内归零”:a16z对谈全球最大推理引擎vLLM创始人

《AI + a16z》是硅谷顶级风投Andreessen Horowitz(a16z)旗下的AI主题播客,常邀请AI基础设施与前沿研究领域的创始人和技术领袖对谈,风格偏技术深度。
本期嘉宾Simon Mo,是vLLM开源推理引擎的核心维护者、Inferac公司联合创始人兼CEO。vLLM是目前全球使用最广的开源大模型推理引擎,在任意时刻运行于超过50万块GPU之上。
嘉宾Matt Bornstein是a16z普通合伙人,长期关注AI基础设施投资,从项目早期就跟踪vLLM团队。
▍本期聊什么
这期对话回答一个核心问题:开源AI是怎么从“爱好者的玩具”变成整个行业离不开的关键基础设施的?
两人从大模型推理为什么难讲起,聊到企业为什么纷纷转向开源模型、开源模型靠什么赚钱养活自己、闭源模型的内容审核为什么把用户逼走,最后落在一个大胆的预测上——
开源和闭源模型的能力差距,一年内就会消失。

▍01
推理引擎为什么会存在:从 BERT 开始,普通电脑跑不动 AI 模型了。
“ResNet你还勉强能在普通CPU上跑,只是慢。但到了BERT,你必须上GPU,否则翻译、任何任务都无从谈起。那还是2020年之前的事。”
—— Simon Mo
这就是推理引擎这类软件存在的原因:模型太大,必须有专门的软件把GPU的算力喂给它。
大语言模型更是如此——每个用户的请求长短不一、模型的输出无法预测,怎么调度、怎么排队、怎么省钱,都成了核心难题。vLLM做的就是这件事。
▍02
2023 年是分水岭:当所有人离不开 ChatGPT 时,背后的开源软件也成了关键基础设施。
“什么时候变得关键?当人们的日常生产力依赖它的时候。大概2023年,GitHub Copilot和ChatGPT成了人们没法离开的东西。那一刻,开放权重模型已经是支撑日常生活的基石了。”
—— Simon Mo
软件什么时候从“有用”变成“离不开”?Simon给出了一个明确的时间点。
创业公司想通了一件事:只调用 OpenAI 的接口做产品,建立不起自己的竞争壁垒,出路是开源模型。
“大约一年前,一批新兴应用公司开始问自己:怎么才能真正构建AI,而不只是在OpenAI上面套一层壳?答案最终指向了开源。Cursor是这么做的,Decagon和Harvey也在走这条路。你需要自己做训练、做推理优化——而闭源厂商不会给你这些权限。”
—— Matt Bornstein
在Matt看来,对创业公司而言,真正的转折发生得更晚,大约在一年前。
如果你的产品只是调用别人的API,那任何人都能复制你。想建立真正的技术优势,就得拿到模型本身去改、去调、去针对自己的场景深度优化——只有开源模型允许你这么做。
而vLLM恰好站在这个转变的枢纽上:支持超过一千种模型架构,NVIDIA、AMD、Google等所有硬件厂商的新芯片都会确保兼容它,很多厂商甚至拿它当性能测试基准。
▍04
一次新模型发布的幕后:十几家公司联合作战,还有一个手忙脚乱的周末。
“有的实验室已经在内部用vLLM了,我们找上门时对方直接说:代码都写好了,你们审核合并就行。另一些实验室完全不懂推理系统怎么回事,那不是他们的专长。每次发布通常牵扯模型实验室、硬件厂商、我们、Hugging Face,再加上十到二十家发布伙伴。”
—— Simon Mo
身处枢纽位置,意味着每次重磅模型发布,vLLM团队都在幕后忙碌。Simon 讲了讲幕后的故事。
最经典的一幕发生在2023年:法国明星创业公司Mistral发布第一个模型时,只在网上扔了一个BT下载链接,全世界的开发者下载下来却跑不起来。vLLM团队和Mistral赶了一个周末的工,周一联合宣布:支持了,能跑了。
▍05
企业转向开源的真正原因是控制权:响应速度、数据去向、系统稳定性,都要握在自己手里。
“做电话语音客服的公司,必须保证模型在规定时间内开口回答。这只有掌控自己的系统才做得到——你清楚自己跑在什么硬件上、监控着什么,而不是把关键业务押在一个可能随时宕机或涨价的第三方API上。”
—— Simon Mo
回到商业问题,企业放着现成的API不用,为什么要自己扛这些麻烦?Simon 说,答案不是省钱。
他算了笔具体的账:闭源模型通常只给你“标准”和“快速”两个档位可选。而开源模型自己部署,可以调出十个不同的速度档——从最省钱的慢速档,到每秒输出四五百个词的极速档(比市面上闭源的“快速模式”还快两三倍)。
再加上数据不外流、合规自己管,这才是开源模型的真正价值:“把顶级的智能,变成你可以真正拥有的东西。”
▍06
闭源模型的内容审查误判太多:连正经写代码都会被拦截,用户正在被逼走。
“我们研究GPU底层代码时,一个普通的报错信息就会触发安全红线。两小时的任务,一次误判,全部工作丢失。所以很多同事改用了Kimi K3,质量差不多,但它的安全规则是讲道理的。”
—— Simon Mo
关于“控制权”,Simon还讲了一个发生在自己团队身上的真实故事,那就是他们被闭源模型的安全审查误伤了。
闭源模型厂商为了防止AI被滥用,设置了各种自动拦截规则,但这些规则经常误判,把完全正当的使用也拦下来。

Simon的判断是内容审核这个问题几乎不可能完美解决,所以对于正当的使用场景,人们最终会默认选择开源模型。因为只有自己部署的模型,安全规则才由你自己定。
Matt补充了一个类比:社交媒体平台有法律免责条款(平台不为用户言论负责),审核问题才勉强可控,而AI公司没有这层保护,有些还主动叠加了超出法律要求的伦理审查。出发点可以理解,但用户体验极其挫败。
▍07
开源模型的钱袋子问题:像新药研发一样,必须有收入回流,才养得起下一代模型。
“我不可能下班后和朋友一起训练个前沿模型玩,那需要数十亿美元的算力。所以必须有经济激励。对中国的模型公司尤其如此——如果月之暗面没有资金来源,我们知道钱会从哪来,而那个来源对我们更糟。”
—— Matt Bornstein
聊完了需求端,还有一个绕不开的供给端问题:训练一个模型要花几亿美元,开源出去免费给人用,钱从哪来?
传统开源软件靠程序员业余贡献代码就能维持,但AI模型不行,训练太贵了。
所以开源模型的授权条款正在演变:从早年的完全免费随便用,到Meta的Llama首创“公司规模超过门槛就要付费签约”(全球只有两家公司踩线),再到如今各家的用量条款。
Simon用制药行业类比。新药上市后的收益回流研发,下一款药才有着落,模型也是同样的逻辑。区别在于,药有专利保护别人不能仿制,而模型一旦开源人人可取,“附加一点付费条款,恐怕是最温和的方案了”。
▍08
“即使是今天,我也看不到大的能力差距。这些模型都是同样的配方做出来的:算力集群、训练数据、一群天才研究员。真正拉开差距的不是谁的数据更多,而是谁能构建最好的训练环境、谁能让模型在环境里学到最多东西。”
—— Simon Mo
铺垫了这么多,节目最核心的问题终于摆上桌面:开源模型和OpenAI、Anthropic这些闭源巨头相比,到底还差多远?
Simon的核心判断:开源和闭源在能力上已经没有差距,未来的竞争焦点是谁能建出更好的“训练环境”。
“训练环境”指的是让模型反复练习、自我改进的模拟场景。他举了Kimi K3的例子:月之暗面搭建了顶级的前端编程练习环境,让模型写代码、看页面渲染效果、再修改、再看,循环迭代,越练越强。
这里也顺带回应了“中国模型是不是靠蒸馏(偷学)美国模型”的争议。“环境是无法被蒸馏的。你偷不走别人的训练环境,也偷不走模型在环境中学习的过程。”
言下之意是,如果政策制定者以为“禁止蒸馏就能卡住对手”,那是搞错了进步的真正来源。
▍09
节目尾声的一个动人细节:一项核心技术的发明者,亲手在新模型里废掉了自己的发明。
“旋转位置编码(RoPE)是几乎所有大模型都在用的基础技术,第一篇论文是Jenning写的。而现在,K3技术报告里论证‘为什么不再需要它’的,也是他本人。我们读到时觉得,真是一种奇妙的轮回。”
—— Simon Mo
Matt感慨这正是AI领域的奇特之处——实践上效果好得惊人,理论上却没人说得清为什么。教科书刚讲完这项技术为何不可或缺,研究再深入一层才发现原来不需要,更简单反而更好。
▍编者按
从vLLM一路聊到Kimi K3,这期节目真正反复出现的,其实不是“开源”两个字,而是“控制权”。
谁控制模型怎么跑、控制数据流向哪里、决定安全边界、有能力针对自己的业务继续训练……正在变得比“谁先做出一个更强的模型”更重要。
过去几年,AI行业最显眼的竞争发生在模型榜单上。而下一阶段,竞争可能会越来越往下沉,进入推理引擎、训练环境、硬件适配和企业工作流这些不那么性感、却决定模型最终能不能真正被使用的地方。
这也是为什么vLLM这样一个最初只是为了“让模型跑得更快”的开源项目,会逐渐变成AI产业的基础设施。
而节目最后那个关于RoPE的故事,恰好给这场讨论做了一个很好的注脚——AI领域没有多少东西是真正不可替代的。
昨天还是大模型的基础组件,今天它的发明者已经开始证明它可以被删掉。今天看起来牢不可破的技术壁垒,明天也可能只是下一代系统里被绕过去的一层旧设计。
真正难以复制的,从来不是某一项技术本身,而是持续把旧答案推翻、再重新找到更好答案的能力。