直播预告 | NEO 系列:迈向统一的端到端原生多模态智能

📣北京时间8月11日(周二)晚19点将门-TechBeat人工智能社区组织的线上 Talk《NEO 系列:迈向统一的端到端原生多模态智能将在视频号准时直播。

本次直播我们很开心邀请到——南洋理工大学博后研究员刁海文他将从现有多模态 AI 存在性能与建模权衡的现状出发,介绍 NEO 系列端到端统一多模态范式,该范式直接作用于像素与文本原生输入,舍弃视觉编码器与变分自编码器,摆脱预训练先验带来的结构约束,规避不同表征间的取舍问题。
点击下方“预约”,锁定直播👇🏻
直播介绍
主题:NEO 系列:迈向统一的端到端原生多模态智能
时间:北京时间 8 月 11 日 (周二) 19:00
简介:
长期以来,多模态人工智能通常采用视觉编码器(VE)实现视觉感知,并依赖变分自编码器(VAE)完成图像生成。近期研究尝试通过共享分词器统一理解与生成,但此类方案往往伴随着一定的性能或建模折衷。我们重新审视这一问题的基本出发点:能否构建一种直接作用于原生输入,即像素与文本的统一模型。基于此,先后发布原生、统一且端到端的多模态范式 NEO 系列工作。该范式不再局限于不同表征形式之间的权衡,并尝试摆脱预训练先验及扩展规律所带来的结构性约束。无需视觉编码器,亦无需变分自编码器。
Talk 大纲:

本次分享将围绕原生视觉语言模型的发展路径展开,主要包括以下三个部分:

1. Native VLMs for Image Understanding

 介绍原生视觉语言模型的基本设计与训练方法,探讨如何在不依赖独立视觉编码器的情况下,直接从像素中学习视觉语言表征。主要包括:

- Native Vision-Language Primitive 的架构设计 

- 原生视觉语言模型的训练范式与数据配方 

- 视觉与语言模态之间的优化冲突及其缓解方法 

2. Native VLMs for One-Vision Understanding

 进一步将原生视觉理解能力扩展至更广泛的视觉输入形式,构建统一处理不同视觉场景的 One-Vision 模型。主要包括:

- 单图、多图、视频与三维空间信息的统一建模 

- 基于稠密语言模型骨干的端到端视觉理解 

- 跨图像关联、时空推理与长视觉上下文建模 

- 从单一图像能力向通用视觉能力的扩展 

3. Native VLMs for Unified Models

 在原生视觉理解的基础上,进一步探索理解与生成一体化的端到端多模态模型。主要包括:

- 无视觉编码器、无 VAE 的原生像素建模 

- 理解与生成任务之间的非对称性设计 

- 无损视觉表征与像素空间生成 

- 基于 MoT Backbone 的统一多模态建模 

- 图像理解、图像生成与多模态推理的协同学习

参考资料

论文标题:

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

论文链接: 

https://arxiv.org/abs/2510.14979

论文标题:

From Pixels to Words -- Towards Native One-Vision Models at Scale

论文链接: 

https://arxiv.org/abs/2605.28820

论文标题:

NEO-unify: Building Native Multimodal Unified Models End to End

论文链接: 

https://huggingface.co/blog/sensenova/neo-unify

论文标题:

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

论文链接: 

https://arxiv.org/abs/2605.12500

讲者介绍

刁海文

南洋理工大学·博士后研究员

刁海文现任新加坡南洋理工大学 MMLab@NTU 博士后研究员,合作导师为刘子纬教授。此前,他于大连理工大学获得博士学位,师从卢湖川教授。他的研究主要聚焦于原生多模态基础模型、生成与理解一体化以及具身智能,主导研发了 EVE、NEO 和 SenseNova-U 等系列模型。相关工作入选 NeurIPS Spotlight 和 ICCV Highlight,并在开源社区获得广泛关注。

直播预约

AI 学术长跑中的女性力量与科研定力:与 6 位高校老师的线上闭门交流
北京时间8月11日(周二) 晚20:00截止报名
详情点击图片跳转

-The End-

本周上新!
扫码观看!

“AI技术流”原创投稿计划

TechBeat是由将门创投建立的AI学习社区(www.techbeat.net社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。

投稿内容

// 最新技术解读/系统性知识分享 //

// 前沿资讯解说/心得经历讲述 //

投稿须知

稿件需要为原创文章,并标明作者信息。

我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励

投稿方式

发送邮件到

yimingzhang@thejiangmen.com

或添加工作人员微信(aceyiming投稿,沟通投稿详情

关于我“
将门是一家以专注于数智核心科技领域新型创投机构,也是北京市标杆型孵化器公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
    
点击右上角,把文章分享到朋友圈