直播预告 | NEO 系列:迈向统一的端到端原生多模态智能
📣北京时间8月11日(周二)晚19点,将门-TechBeat人工智能社区组织的线上 Talk《NEO 系列:迈向统一的端到端原生多模态智能》将在视频号准时直播。
长期以来,多模态人工智能通常采用视觉编码器(VE)实现视觉感知,并依赖变分自编码器(VAE)完成图像生成。近期研究尝试通过共享分词器统一理解与生成,但此类方案往往伴随着一定的性能或建模折衷。我们重新审视这一问题的基本出发点:能否构建一种直接作用于原生输入,即像素与文本的统一模型。基于此,先后发布原生、统一且端到端的多模态范式 NEO 系列工作。该范式不再局限于不同表征形式之间的权衡,并尝试摆脱预训练先验及扩展规律所带来的结构性约束。无需视觉编码器,亦无需变分自编码器。
本次分享将围绕原生视觉语言模型的发展路径展开,主要包括以下三个部分:
1. Native VLMs for Image Understanding
介绍原生视觉语言模型的基本设计与训练方法,探讨如何在不依赖独立视觉编码器的情况下,直接从像素中学习视觉语言表征。主要包括:
- Native Vision-Language Primitive 的架构设计
- 原生视觉语言模型的训练范式与数据配方
- 视觉与语言模态之间的优化冲突及其缓解方法
2. Native VLMs for One-Vision Understanding
进一步将原生视觉理解能力扩展至更广泛的视觉输入形式,构建统一处理不同视觉场景的 One-Vision 模型。主要包括:
- 单图、多图、视频与三维空间信息的统一建模
- 基于稠密语言模型骨干的端到端视觉理解
- 跨图像关联、时空推理与长视觉上下文建模
- 从单一图像能力向通用视觉能力的扩展
3. Native VLMs for Unified Models
在原生视觉理解的基础上,进一步探索理解与生成一体化的端到端多模态模型。主要包括:
- 无视觉编码器、无 VAE 的原生像素建模
- 理解与生成任务之间的非对称性设计
- 无损视觉表征与像素空间生成
- 基于 MoT Backbone 的统一多模态建模
- 图像理解、图像生成与多模态推理的协同学习
参考资料
▼

论文标题:
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
论文链接:
https://arxiv.org/abs/2510.14979

论文标题:
From Pixels to Words -- Towards Native One-Vision Models at Scale
论文链接:
https://arxiv.org/abs/2605.28820

论文标题:
NEO-unify: Building Native Multimodal Unified Models End to End
论文链接:
https://huggingface.co/blog/sensenova/neo-unify

论文标题:
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
论文链接:
https://arxiv.org/abs/2605.12500

刁海文 南洋理工大学·博士后研究员
刁海文现任新加坡南洋理工大学 MMLab@NTU 博士后研究员,合作导师为刘子纬教授。此前,他于大连理工大学获得博士学位,师从卢湖川教授。他的研究主要聚焦于原生多模态基础模型、生成与理解一体化以及具身智能,主导研发了 EVE、NEO 和 SenseNova-U 等系列模型。相关工作入选 NeurIPS Spotlight 和 ICCV Highlight,并在开源社区获得广泛关注。
直播预约


AI 学术长跑中的女性力量与科研定力:与 6 位高校老师的线上闭门交流北京时间8月11日(周二) 晚20:00截止报名 详情点击图片跳转
-The End- 本周上新! 
扫码观看!
南洋理工大学·博士后研究员
刁海文现任新加坡南洋理工大学 MMLab@NTU 博士后研究员,合作导师为刘子纬教授。此前,他于大连理工大学获得博士学位,师从卢湖川教授。他的研究主要聚焦于原生多模态基础模型、生成与理解一体化以及具身智能,主导研发了 EVE、NEO 和 SenseNova-U 等系列模型。相关工作入选 NeurIPS Spotlight 和 ICCV Highlight,并在开源社区获得广泛关注。
直播预约


AI 学术长跑中的女性力量与科研定力:与 6 位高校老师的线上闭门交流北京时间8月11日(周二) 晚20:00截止报名 详情点击图片跳转
-The End- 本周上新! 
扫码观看!

AI 学术长跑中的女性力量与科研定力:与 6 位高校老师的线上闭门交流北京时间8月11日(周二) 晚20:00截止报名 详情点击图片跳转

本周上新! 
扫码观看!

“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
yimingzhang@thejiangmen.com
或添加工作人员微信(aceyiming)投稿,沟通投稿详情

