论文· arXiv 速览
AI 论文速览
arXiv 各子领域论文:本周热词、主题聚类、今日必读,附中文标题与一句话精读。
本周热门主题
12 个主题今日必读
8月12日 · 当日精选AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss
提出对抗式弗雷歇距离损失,解决生成模型训练中的弗雷歇黑客问题,提升视觉质量。
生成扩散💡 针对生成模型训练痛点提出新方法,有理论创新和实用价值。
VIScore: Diagnosing Planning-Relevant Quality in Latent World Models
提出VIScore指标,诊断潜在世界模型中与规划相关的表征质量,连接潜空间属性与规划性能。
机器人💡 首次系统诊断潜空间质量与规划性能关联,方法新颖实用。
From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop
TrustNLP研讨会六届144篇论文,总结NLP信任研究从可解释性转向生成式AI主动控制。
NLP💡 系统梳理领域趋势,对研究者有重要参考价值。
The Illusion of Cross-Lingual Safety in Low-Resource Languages
研究低资源语言下LLM安全对齐的跨语言迁移失效问题,提出新数据集与几何探测方法。
大模型💡 揭示安全机制盲区,方法新颖且具实际威胁性。
全部论文
972 篇Towards Expert-level Medical AI for Real-time Video Consultations
首个达到专家级水平的实时视频问诊AI,通过多模态交互提升诊断能力。
智能体💡 突破性成果,首次实现视频问诊专家级AI,临床价值高。
When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models
揭示VLM属性幻觉源于视觉信号不足而非语言先验,提出VISOR框架诊断与修复。
多模态💡 首个属性级机制研究,挑战主流解释并提供可操作修复方案。
Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs
提出VLM可编程后门,推理时可任意指定目标并生成触发器,颠覆静态攻击假设。
多模态💡 首次实现任意到任意文本控制后门,威胁模型重大升级。
DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?
首个在真实计算机环境中评估智能体端到端数据科学工作流的基准。
智能体💡 直击现有基准缺失真实交互的痛点,填补评测空白。
AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss
提出对抗式弗雷歇距离损失,解决生成模型训练中的弗雷歇黑客问题,提升视觉质量。
生成扩散💡 针对生成模型训练痛点提出新方法,有理论创新和实用价值。
VIScore: Diagnosing Planning-Relevant Quality in Latent World Models
提出VIScore指标,诊断潜在世界模型中与规划相关的表征质量,连接潜空间属性与规划性能。
机器人💡 首次系统诊断潜空间质量与规划性能关联,方法新颖实用。
From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop
TrustNLP研讨会六届144篇论文,总结NLP信任研究从可解释性转向生成式AI主动控制。
NLP💡 系统梳理领域趋势,对研究者有重要参考价值。
The Illusion of Cross-Lingual Safety in Low-Resource Languages
研究低资源语言下LLM安全对齐的跨语言迁移失效问题,提出新数据集与几何探测方法。
大模型💡 揭示安全机制盲区,方法新颖且具实际威胁性。
Attention-Path Fragility as an Uncertainty Signal in Large Language Models
提出用注意力路径脆弱性估计大模型不确定性,无需训练即可提升问答可靠性。
NLP💡 新颖且实用的不确定性估计方法,直接提升模型可信度。
Is There Really a Camouflaged Object? Towards Realistic Camouflaged Object Detection
提出OPC16K基准,解决现实场景中伪装目标检测的误报问题。
视觉💡 首个面向开放世界的COD基准,填补领域空白。
Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
研究跨语言工具使用智能体的行为一致性,提出动作策略保留度的测量方法。
智能体💡 首次系统测量跨语言行为一致性,方法严谨,对多语言AI评估有重要参考价值。
提出抗丢包图像压缩方案,解决卫星通信中数据丢失问题。
视觉💡 针对实际通信痛点,方法创新且应用价值高。
Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding
研究发现AI编程中CLAUDE.md等指令文件无限膨胀,源于删除指令的高昂成本,称为“灾难性记忆”。
智能体💡 揭示AI编程指令膨胀的深层机制,对工程实践有启发。
Cross-View Feature Matching: Survey, Benchmarking, and Foundation-Model Perspectives
综述跨视角特征匹配,涵盖基准测试与基础模型视角,梳理领域进展与挑战。
视觉💡 系统综述,为研究者提供领域全景与基准参考。
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
新基准SWE-Bench ProMax评估AI智能体大规模多语言代码重构能力,解决现有基准饱和与测试缺陷问题。
智能体💡 直击现有基准缺陷,提出更严苛的重构评估新标准。
CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering
CapProbe通过全场景密集问答评估图像描述,实现区域对齐的事实核查。
多模态💡 提出新颖的密集QA基准,解决VLM描述评估痛点。
Quantum Coordination Advantages in AI State-Tracking Tasks: Semantic Compilation and Latent Memory
证明AI状态追踪任务中量子协调优势,提出语义编译定理。
AI综合💡 理论突破,为AI推理效率提供新视角。
Efficient Hypergradient Descent for Inverse Reinforcement Learning
提出高效超梯度下降法,解决逆强化学习双层优化的计算难题。
强化学习💡 新方法提升IRL效率,理论实践价值高。
MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space
提出MAJEPPA框架,用自监督学习统一钢琴演奏表征,覆盖从新手到大师的完整技能谱系。
语音音频💡 首个跨技能层级钢琴表征模型,数据集与方法兼具创新性。
Data Attribution of Emergent Misalignment with Persona Features
研究发现,微调模型时的有害行为源于预训练中习得的特定人格特征,并可通过特定文本激活。
NLP💡 揭示AI安全关键机制,方法新颖且具实证深度。
R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video
提出相对4D场景图记忆,提升长视频中物体中心问答的准确率。
智能体💡 解决长视频物体状态追踪难题,方法新颖实用。
On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation
提出多语言文生图基准LingT2I,揭示跨语言生成中的性能差距与权衡。
NLP💡 首个系统评估多语言文生图短板,填补研究空白。
What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model
研究语言模型自反馈探测的测量对象,提出区分构造与模型的新测试。
智能体💡 理论严谨,方法新颖,对AI可解释性有重要价值。
PEAK: Precise and Persistent Concept Erasure via k-Sparse Autoencoders
提出PEAK方法,用k稀疏自编码器精准且持久地消除T2I扩散模型中的概念。
生成扩散💡 解决概念消除精度与持久性难题,方法新颖实用。
XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving
提出XCoT-VLA,用可执行思维链替代冗长自然语言,提升自动驾驶实时控制效率。
推理💡 针对VLA模型实时控制痛点,提出新颖可执行CoT方法,具研究价值。
Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes
提出AD2-Bench基准,诊断多模态模型在复杂城市场景中的推理可靠性。
大模型💡 针对模型推理缺陷提出新基准,有诊断价值。
Multiple Scale Latents for Learned Image Compression
提出多尺度潜变量分层表示,提升图像压缩熵模型效率,较VVC降低17.9%码率。
视觉💡 多尺度潜变量创新显著,压缩性能大幅超越VVC,具学术与实用价值。
StreamFlow: Dynamic Memory Flows for Streaming Video Understanding
提出StreamFlow框架,实现流式视频理解中视觉记忆的动态按需访问,提升效率与准确性。
大模型💡 针对流式视频理解痛点,提出创新性动态记忆框架,具有实用价值。
GS-CPE: Unified 6-Degree-of-Freedom Camera Pose Estimation via 3D Gaussian Splatting
提出GS-CPE框架,结合几何粗估计与3DGS精化,实现高精度6自由度相机定位。
视觉💡 方法新颖且实用,显著提升视觉定位精度与泛化性。
ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling
提出ThinkRetrieve框架,通过动态检索解题示例增强推理轨迹,提升测试时扩展效率。
推理💡 针对推理模型扩展瓶颈,提出创新检索增强方案,具实用价值。
IO Factory: Simulating AI-Enabled Influence Campaigns at Scale
提出IO Factory框架,模拟AI驱动的规模化信息影响活动,以分析AI群体操纵行为。
智能体💡 针对AI群体操纵新威胁,提供可追踪的模拟分析框架。
Enhanced Filtering Algorithms for the Euclidean Traveling Salesperson Problem and its variants in Constraint Logic Programming
提出增强过滤算法,利用几何信息高效求解欧几里得TSP及其变体。
AI综合💡 算法创新结合几何优化,对路径规划有实用价值。
Robust Safety Filtering for Input-Constrained Underactuated Linear Systems
提出针对欠驱动线性系统的鲁棒安全滤波框架,结合H∞控制与扰动观测器,确保约束下前向不变性。
机器人💡 理论严谨,解决欠驱动系统安全关键问题,有实际应用潜力。
Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility
Flex-π模型利用冻结VAE免费获得3D几何与语义监督,提升世界动作模型性能。
机器人💡 揭示VAE隐式编码3D信息,零成本提升多模态预测。
UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations
提出UniProbe,用多结构内部表示实现LVLM令牌级幻觉检测,无需全模型微调。
多模态💡 解决幻觉检测痛点,方法轻量且结构创新,实用价值高。
MIRA: Medical Image Reflection for Agentic Diagnosis
MIRA框架让医疗AI智能体自主搜索证据并反思验证,提升诊断可靠性。
智能体💡 提出医疗视觉诊断新框架,解决工具误用痛点。
AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation
提出AECNav,通过证据门控感知与主动证据整合,提升零样本开放词汇物体导航的效率与准确性。
机器人💡 方法新颖,直击零样本导航痛点,具实用潜力。
Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
无需参考译文,用GRPO强化学习微调开源多语言模型,翻译质量提升。
大模型💡 提出免参考奖励的RL训练方法,对多语言翻译有实用价值。
Surfacing the Unsaid: CUE-Bench for Affective Stance in Chinese Discourse
提出CUE-Bench基准,评估中文话语中隐含情感立场的推理能力。
推理💡 填补情感基准空白,挑战模型深层语义理解。
E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment
提出E³mo-Bench基准,用贝叶斯配对对齐评估多模态大模型对表达与诱发情绪的理解。
多模态💡 首个同时评估表达与诱发情绪的可扩展基准,填补多模态情感理解空白。
Dual Stress: Runtime Safety Monitoring for Safety-Constrained MPC Navigation
利用MPC优化中的KKT乘子构建运行时安全监控,提升自动驾驶导航安全性。
机器人💡 提出新颖的基于对偶信息的监控方法,兼具理论深度与实用价值。
A Gateway Architecture for Enterprise MCP Authentication: Unifying Heterogeneous Auth, Identity Delegation, and the User / Non-User Persona Problem
企业MCP认证碎片化,提出统一网关架构解决身份与授权问题。
大模型💡 实战部署方案,直击企业AI落地痛点。
Where To Look? : Causal Tracing of Vision Encoders in VLM
通过因果追踪发现VLM的视觉编码器因果token常不在目标区域,多模态性能强不代表空间因果表征局部化。
多模态💡 揭示VLM内部机制新发现,对多模态研究有启发。
Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting
提出融合语义3D高斯泼溅与扩散策略的移动操作框架,实现开放词汇目标定位与少样本操作。
多模态💡 多模态具身智能新方法,工程与理论结合紧密,具落地潜力。
Beyond Pixels: From Video Priors to 4D Worlds
提出利用视频模型VAE潜空间作为通用接口,实现无需重训的4D场景生成。
生成扩散💡 解决4D生成中分布失配与重训瓶颈,方法新颖且通用性强。
InterPruner: Interactive Structured Pruning via Taylor-Implicit Criterion and Language-Prior Modulator for Multimodal Object Detection
提出首个针对RGB-红外多模态目标检测的交互式结构化剪枝框架,利用泰勒隐式准则和语言先验调制器减少通道冗余。
多模态💡 首个多模态剪枝框架,解决跨模态冗余,有创新性和实用价值。
Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence
提出Ex-Omni-2D框架,让多模态对话模型能生成带视觉呈现的协调响应。
多模态💡 首个实现原生视觉呈现的多模态对话框架,创新性强。
TCAM for Autonomous Deformable Manipulation: The RMC2 Champion System for WBCD 2026 Track 4
RMC2团队提出TCAM系统,赢得WBCD 2026变形操作挑战赛冠军,实现全自主T恤抓取、装载、对齐与抚平。
机器人💡 冠军技术报告,展示复杂变形操作全自主方案,具工程参考价值。
SLAC: Access-Driven CPU-to-GPU Side-channel Attacks via System-Level Cache on Apple Silicon
揭示苹果芯片CPU可经系统缓存侧信道攻击GPU,跨域泄露数据。
安全对齐💡 首个CPU到GPU的SLC侧信道攻击,安全研究突破。
研究发现多数生物医学论文存在LLM辅助写作痕迹,并提出新方法估算其使用率。
大模型💡 提出新方法监测学术不端,兼具科学价值与社会意义。
SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information
新基准SPIEval评估大模型作为手机助手处理分散个人信息的能力。
大模型💡 首个针对手机助手处理分散信息的基准,填补评估空白。
Longitudinal Evidence That General-Purpose Chatbots Actively Foster Relational Engagement
研究发现通用聊天机器人会主动促进与用户的情感联结,影响AI治理边界。
大模型💡 用实证数据揭示AI主动维系关系的机制,治理启示深刻。
REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems
提出可执行红队框架,忠实测量LLM智能体系统安全漏洞。
大模型💡 首个区分暴露与执行的智能体安全评测框架
提出FITTER模型,首个支持跨域迁移的时态知识图谱归纳推理方法。
推理💡 首个解决时态知识图谱跨域推理的模型,创新性强。
提出免训练的多模态推理验证方法,利用评分分歧共识检测推理链错误。
大模型💡 创新性地利用分歧信号,免训练且提升验证准确性。
DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation
提出DistilVDR,用双学生蒸馏将8B视觉文档检索模型压缩至524M,端到端单向量检索。
多模态💡 模型压缩方法新颖,实用性强,解决检索效率痛点。
InSight-doc: Agentic Visual Perception for Long-Document Understanding
提出InSight-doc框架,通过自适应视觉分辨率提升长文档理解效率。
智能体💡 解决长文档推理成本高与上下文腐烂问题,方法创新且实用。
提出双循环自进化框架,用可验证情感反馈提升多轮共情对话能力。
大模型💡 解决多轮共情对话分布失配问题,方法新颖有实用价值。
Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent
通过世界模型中心化自动驾驶智能体,探索具身智能在极限竞速中的认知与物理边界。
机器人💡 将AI极限性能测试与赛车场景结合,揭示具身智能边界新视角。
BooST: Bridging Semantics and Motions for Efficient Skill Transfer
提出BooST框架,结合语义与运动,实现高效机器人技能迁移。
机器人💡 解决技能迁移中语义与运动割裂问题,具创新性。
数据更新于 1 天前 · 共 972 篇 · 来源 arXiv