Emu3多模态模型:下一词预测统一视觉语言生成新范式 北京智源人工智能研究院推出的Emu3系列模型,通过单一下一词预测目标,在统一Transformer架构下实现图像、文本、视频乃至动作的联合建模,突破传统扩散模型和组合架构限制。该模型在生成与感知任务上达到或超越专用SOTA系统,为多模态统一 Emu3多模态AI下一词预测 2026-07-02👁 13查看