AI EarlyView
Pro
AI EarlyView
← 最新论文日报
7月9日· 周四

arXiv 论文日报

3D与具身智能突破

今日亮点:3D理解与生成统一框架ELSA3D、4D具身世界模型RynnWorld-4D,以及多模态VLA模型Lift3D-VLA。此外,扩散模型在密集预测和自动驾驶仿真中展现新潜力。

📄 10 篇精选</> 1 篇带代码🏆 7 篇 SOTA
📈 趋势速览具身智能与3D视觉升温:多篇论文聚焦机器人操作与导航(RynnWorld-4D、UniLM-Nav、Lift3D-VLA),3D统一框架(ELSA3D)和扩散模型应用(ProxyPose、Point as Skeleton)成为热点。
1
💡 统一3D理解与生成,首次实现弹性语义锚定。
推理Tianjiao Yu、Xinzhuo Li、Yifan Shen
2
💡 4D世界模型提升机器人操作,RGB-DF多模态创新。
机器人Haoyu Zhao、Xingyue Zhao、Siteng Huang
3
💡 将姿态追踪转为视频翻译,仅需单像素标注。
生成扩散Ruihang Zhang、Felix Taubner、Pooja Ravi
4
💡 文生图模型直接用于密集预测,避免生成冗余。
视觉Zanyi Wang、Xin Lin、Haodong Li
5
💡 解决全双工语音模型模态干扰,分层建模。
NLPZhenyu Liu、Yunxin Li、Xuanyu Zhang
6
💡 点云骨架增强自回归生成,实现闭环仿真。
生成扩散Songbur Wong、Xiaosong Jia、Junqi You
7
💡 零样本开放词汇导航,统一框架简化部署。
机器人Zhuofan Zhang、Tianxu Wang、Guoxi Zhang
8
💡 双通路控制框架,兼具学习加速与鲁棒性。
机器人Fan Zhang、Richie Suganda、Jinfeng Chen
9
💡 提升VLA模型3D几何与动态操作能力。
多模态Jiaming Liu、Qingpo Wuwu、Nuowei Han
10
Vision as Unified Multimodal Generation
💡 视觉统一多模态生成,无需任务专用架构。
多模态Xiaoyang Han、Jianhua Li、Kewang Deng

生成于 07:03 · 来源 arXiv · AI 编排

往期日报