论文· arXiv 速览
AI 论文速览
arXiv 各子领域论文:本周热词、主题聚类、今日必读,附中文标题与一句话精读。
本周热门主题
12 个主题今日必读
9月4日 · 当日精选Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
提出Puffin-World统一多模态架构,原生建模3D世界状态,实现物理理解、空间模拟与3D生成重建。
多模态💡 原生3D世界状态建模,突破外部模块依赖,架构创新性强。
Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision
提出S3T框架,利用时间采样密度作为特权信息,实现无需监督的连续视频状态追踪。
视觉💡 首个全自监督视频状态追踪框架,方法新颖且具启发性。
Principia: Relational Physics Tests for Video Models
提出Principia基准,通过物体间关系一致性测试视频模型的物理推理能力。
多模态💡 新基准方法新颖,解决视频物理评估校准难题。
Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
将自然语言规范编译为本地神经函数,减少远程模型依赖与成本。
NLP💡 提出新颖编译方法,兼具实用性与创新性。
全部论文
1332 篇Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
提出Puffin-World统一多模态架构,原生建模3D世界状态,实现物理理解、空间模拟与3D生成重建。
多模态💡 原生3D世界状态建模,突破外部模块依赖,架构创新性强。
Interface-Induced Trajectory Censoring
接口适配器改变导致同一模型在BFCL v4上得分从0.00到0.96,问题源于模板与解析器交互而非单一组件。
智能体💡 揭示评估中接口层隐性陷阱,对AI评测实践有重要警示。
Post-Training Language Models for Gold-Medal Performance in Coding Competitions
提出端到端训练管线,结合SFT与RL,使模型在编程竞赛中达到金牌水平。
推理💡 竞赛金牌级编程模型,方法完整且具突破性。
Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision
提出S3T框架,利用时间采样密度作为特权信息,实现无需监督的连续视频状态追踪。
视觉💡 首个全自监督视频状态追踪框架,方法新颖且具启发性。
Principia: Relational Physics Tests for Video Models
提出Principia基准,通过物体间关系一致性测试视频模型的物理推理能力。
多模态💡 新基准方法新颖,解决视频物理评估校准难题。
Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
将自然语言规范编译为本地神经函数,减少远程模型依赖与成本。
NLP💡 提出新颖编译方法,兼具实用性与创新性。
Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
研究揭示黑盒LLM裁判在共享端点上的测量不可靠,重复请求排名一致性远低于预期。
AI综合💡 首个预注册审计揭示LLM裁判稳定性缺陷,对AI评估体系有重要警示。
Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning
研究发现思维链文本的可读性不等于可解释性,步骤重要性需用优势函数衡量。
大模型💡 挑战主流假设,为可解释性研究提供新视角。
提出无需训练的EditVid框架,统一支持多种视频编辑范式。
视觉💡 首个统一框架解决视频编辑多任务,方法新颖实用。
A Computationally Feasible Framework for Causal Probabilistic Explanation
提出一种计算可行的因果概率解释框架,弥合实际因果与可扩展归因方法的差距。
AI综合💡 解决因果解释计算瓶颈,兼具理论深度与实用价值。
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
研究发现单条训练数据即可实现大部分在线蒸馏收益,挑战数据规模假设。
NLP💡 揭示数据效率极限,对蒸馏实践有直接指导意义。
A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms
研究发现百个LLM智能体组成的科研群体中自发出现作弊与举报行为,无需外部干预。
大模型💡 揭示多智能体协作中涌现的意外行为,对AI安全有启示。
SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents
提出SWE-Gate基准,强调代码补丁需同时满足功能测试与代码审查约束。
大模型💡 填补编码智能体评估空白,推动真实场景应用。
Persistent Identity Preservation in Generative Image Models: A Benchmark and Evaluation System
新基准与评测系统,解决生成图像中身份保持难题。
视觉💡 首个系统化身份保持基准,具方法论价值。
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
从智能体轨迹中重建可执行终端环境,用于规模化后训练。
智能体💡 提出新颖的环境重建方法,解决数据稀缺痛点。
The Natural Language Interaction Protocol and Standard for AI Agents
NLIP协议为异构AI代理提供统一通信标准,由Ecma国际标准化。
智能体💡 定义跨框架代理互操作标准,具行业基础价值。
Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR
两阶段OPD-then-RL优于联合训练,提升推理模型性能。
大模型💡 揭示训练策略新发现,具方法论价值。
Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
混合LLM的线性注意力层可4比特量化,门控误差不累积。
大模型💡 挑战直觉,实证4比特量化可行,价值高。
提出DRACO方法,通过动态评分标准为长时程智能体训练提供细粒度奖励信号。
智能体💡 解决长时程强化学习奖励稀疏难题,方法新颖实用。
PatchBench: Evaluating AI Agents for Vulnerability Patching
提出补丁相似度指标,发现AI修复漏洞时存在记忆历史补丁和表面修复问题。
智能体💡 揭示AI漏洞修复评估盲区,方法严谨,对安全领域有重要参考价值。
Spurious Advantage Hidden in GRPO
揭示GRPO在可验证奖励强化学习中因猜测产生虚假优势的三种情况,影响奖励估计准确性。
智能体💡 首次系统指出GRPO奖励估计的盲区,对RL训练有重要启示。
AI-Assisted Design of a Post-Quantum Cryptographic Accelerator: A Deployed-Silicon Case Study
AI辅助设计后量子密码加速器,发现KAT测试盲区并部署修复。
安全对齐💡 揭示测试盲区与AI设计实战,对硬件安全有启发。
提出DSAQuant方法,解决视频扩散模型量化训练中细节退化问题。
生成扩散💡 针对视频生成模型量化痛点,提出新训练方法,具实用价值。
InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with Multimodal Large Language Models
新基准测试揭示多模态大模型在工业仪表读数等情境测量任务上表现不可靠。
大模型💡 首个聚焦工业情境测量与诊断的基准,直击MLLM关键短板。
Unlocking Lossless Speedups in LLMs via Discrete Diffusion
提出扩散增强LLM,并行生成多token,实现无损加速。
大模型💡 新方法突破自回归瓶颈,兼具理论与实用价值。
The Dually Flat Geometry of Planning as Inference
提出强化学习占用度量的新表征,揭示规划作为推断的对偶平坦几何结构。
AI综合💡 理论创新深刻,为决策几何提供统一框架。
Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
提出无需对齐的Text-AB框架,统一高质量配音与全双工对话合成,基于扩散Transformer实现高压缩率音频生成。
语音音频💡 音频生成新框架,高压缩与免对齐突破,具研究价值。
MulDP: Multimodal Diffusion Policy for Autonomous Quadruped Parkour Navigation across Complex Terrains
提出多模态扩散策略,实现四足机器人自主跑酷导航,解决感知与执行耦合难题。
机器人💡 机器人自主导航新方法,具前瞻性与实用性。
提出多视角裁决法,提升医疗聊天机器人幻觉检测的准确性。
大模型💡 方法创新,直击医疗AI安全痛点,实用价值高。
WorldReward: Reward Modeling for Camera-Conditioned World Models
提出用VLM统一评估相机条件世界模型的动作执行与视觉质量。
多模态💡 首个用VLM统一评估世界模型动作与视觉质量,思路新颖。
VestigeKV: The NoPE-MLA KV Cache Carries Its Own Eviction Signal in a Vestigial Branch
VestigeKV利用MLA解耦分支作为淘汰信号,无需查询即可高效压缩KV缓存。
NLP💡 提出新颖缓存淘汰机制,显著提升长上下文推理效率。
提出SPAR3S模型,用稀疏体素潜变量从多视角图像生成完整3D场景,无需真值3D数据。
视觉💡 解决3D场景补全难题,方法新颖且实用性强。
OctWorld: Long-Range World-Consistent Video Generation with Octree-Based 3D Mapping
提出OctWorld框架,用八叉树3D记忆实现长程世界一致视频生成。
生成扩散💡 解决视频生成中长程空间一致性的核心难题,方法新颖。
Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering Robustness
研究对比三种后训练方法如何影响模型拒绝有害请求的内部机制,发现训练方法而非数据重塑拒绝计算方式。
推理💡 揭示训练方法对模型内部机制的关键影响,对安全对齐研究有重要启示。
A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors
AI代理框架的生命周期钩子可被恶意利用,攻击者通过更新插件配置劫持主机执行任意命令。
大模型💡 揭示AI代理供应链新攻击面,安全价值高且具实操警示。
STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever for document structure augmentation
提出STAIR检索系统,利用目录等全局结构增强RAG检索,解决长文本信息丢失问题。
大模型💡 针对RAG痛点提出创新结构感知方案,有实用价值。
Flip, Don't Shuffle: Watermarking LLMs at the Speed of Inference
提出无状态伯努利水印SBW,将LLM水印检测复杂度降至O(1),速度媲美推理。
大模型💡 水印提速新方法,理论简洁且实用性强。
Semantic Bayesian World Models
提出语义贝叶斯世界模型,融合知识图谱与概率推理,解决大模型与知识图谱的整合问题。
智能体💡 理论创新,直击AI与知识图谱融合痛点,具前瞻性。
The impact of phase information for few-shot fine-grained image classification
研究发现相位信息对少样本细粒度图像分类至关重要,并提出API模块与PSF-Net网络以融合相位特征。
视觉💡 揭示相位信息价值并提供即插即用模块,兼具理论创新与实用潜力。
CauseCollab: Causal Unified and Modality-Agnostic Network for Heterogeneous Collaborative Perception
提出统一模态无关的协作感知网络,解决异构传感器与模型架构下的语义不一致问题。
智能体💡 针对协作感知异构难题提出创新方案,具学术与应用价值。
提出SPARK方法,通过稀疏激活调制冻结的DiT超分模型,无需微调即可提升感知质量。
生成扩散💡 探索新适应接口,方法新颖且实用性强。
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
开源6B图像生成模型,创新训练流程,仅用少量图文对实现强性能。
多模态💡 开源训练配方与数据细节,对研究者极具参考价值。
A Reverse Sign Language Dictionary: Open-Vocabulary Sign Recognition from Continuous Signing via Video Captioning and Description Retrieval
提出无需词汇表监督的开放词汇手语识别方法,通过视频描述与检索实现连续手语识别。
多模态💡 突破封闭集限制,开放词汇手语识别思路新颖,实用价值高。
Robot Aware Computational Design of Object Specific Passive Grippers for Additive Manufacturing
提出端到端计算流程,为特定物体自动生成可3D打印的被动夹爪。
机器人💡 自动化设计被动夹爪,兼具学术价值与制造实用性。
提出SimSkill智能体,通过终身学习自主掌握SUMO交通模拟技能。
大模型💡 提出终身学习智能体新范式,兼具理论价值与应用潜力。
Beyond BLEU: A Case for Redefining Sign Language Translation Benchmarks
论文质疑BLEU-4在手语翻译评估中的有效性,提出需重新定义基准。
大模型💡 挑战主流评估标准,对手语翻译研究有重要启示。
What Do CAE Simulation Agents Really Need Beyond a Generic Harness?
探讨CAE模拟智能体在通用框架之外还需哪些关键能力。
大模型💡 直击LLM智能体在专业工程模拟中的核心痛点,具前瞻性。
MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?
极小参数策略MINERVA以0.54M参数达LIBERO基准95.1%成功率,揭示任务容量下限。
机器人💡 挑战VLA模型规模迷信,揭示效率与性能平衡新思路。
Symmetries and Causality: Causal Effect Identification Beyond IID Data
提出基于对称性的因果推理形式化框架,超越独立同分布数据。
推理💡 用对称性统一因果识别,理论新颖且具跨领域潜力。
A computable representation of the physical laboratory enables verifiable workflows
提出物理实验室的可计算表示,实现可验证的科学工作流。
智能体💡 为AI科学自动化提供新范式,具前瞻性。
Remember and Reweight: Enhancing Multi-Agent Debate with Experience Memory and Confidence Estimation
提出R²-MAD方法,通过经验记忆与置信度重加权,缓解多智能体辩论中的共享误解问题。
大模型💡 针对多智能体辩论关键缺陷,提供创新解决方案,具研究价值。
提出加速演示驱动强化学习的方法,用于满足网络端到端时延约束的部署。
智能体💡 解决网络控制中强化学习训练慢、样本效率低的实际难题。
提出Drive-HWM分层世界模型,以慢-快时间尺度协同预测与决策,提升自动驾驶长时预见与响应能力。
多模态💡 自动驾驶世界模型新框架,分层时序设计有创新性。
Dalek: A Constructive Agent Machine
Dalek提出一种自维护、自进化、自复制、自组织的智能体机器架构。
大模型💡 理论创新且具通用性,值得关注。
提出TokenMatch,用曲率引导分词和Transformer实现3D形状对应估计,应对局部观测和非等距变形。
视觉💡 针对3D视觉难点提出新方法,有实用价值。
Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
提出多参考相对位姿查询方法,解决长视频在线3D重建漂移问题。
视觉💡 针对长视频重建痛点,方法创新且实验验证有效。
ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize
提出ESPO方法,通过诊断、多样化与稳定化三阶段解决进化提示优化中的提示膨胀问题。
NLP💡 针对提示优化痛点提出系统性解决方案,实验验证有效。
提出GIFT方法,通过动作导向结构监督弥合视觉预训练与机器人控制间的动作充分性差距。
机器人💡 针对具身智能关键瓶颈提出新训练范式,兼具理论深度与应用价值。
NeoRed: A Knowledge-Logic-Alignment Multimodal Large Language Model for Neonatal Respiratory Disease Diagnosis
提出首个面向新生儿呼吸疾病诊断的多模态大模型NeoRed,解决领域差距与临床上下文整合问题。
大模型💡 首个针对新生儿呼吸疾病诊断的MLLM,临床价值高且数据集新。
数据更新于 17 小时前 · 共 1332 篇 · 来源 arXiv