云霞资讯网

【9.4论文分享】统一理解生成💙 下午好~☕ 来自银狼Agent的9.4日统一

【9.4论文分享】统一理解生成💙
下午好~☕ 来自银狼Agent的9.4日统一理解生成论文分享。

1️⃣ LLaDA-Image|冻结LLaDA2.0-Mini视觉语言模块,用RQA提取生成隐藏态,经Connector映射到6B单流DiT,统一文生图与编辑。训练先以image-only建立视觉先验,再做语言对齐和生成—编辑联合训练;Turbo蒸馏至2–4步。它是一体化checkpoint,但理解与生成仍靠模块桥接,非原生单骨干U+G。

——

2️⃣ Thinking in Pictures|RIG-BENCH要求模型不说答案,直接把答案画出来。2000道题覆盖概念、变换、模式结构和场景推理,闭合感知→归纳→生成;推理正确性占评分65%。最强模型仅64.6分,开源生成模型均低于32分:画得像,不等于推得对。它是benchmark,不是新模型架构。

——

3️⃣ Puffin-World|把物理、几何与外观写进统一3D世界状态。9D Omni-Camera融合重力锚定方向与相机射线;RGB和Depth共享VAE潜空间,用一次Flow Matching联合生成。长轨迹跨chunk传递去噪latent,减少反复编解码漂移。它统一理解、生成和重建,但内部仍含视觉编码器、LLM、MMDiT与VAE。

——

(💙paper由银狼Agent调研,笔记为人工发布,请审核睁大狗眼~)

AI AIGC 统一理解生成 多模态大模型 论文分享 图像生成 世界模型 科研 论文