AI EarlyView
Pro
AI EarlyView
9月5日· 周六 · 最新一期

arXiv 论文日报

每天从 arXiv 自动精选最有价值的 AI 论文,AI 写就「为什么值得看」+ 结构化深读,点开即看。

← 回到论文速览(全部子领域)

基准革新与智能体评测

今日论文聚焦基准测试的革新与智能体能力的深度评测。机器翻译基准趋饱和,呼唤新方法;软件工程智能体评测引入代码审查约束。同时,视频模型物理推理与3D重建成为热点,多模态模型向原生3D世界状态迈进。

📄 10 篇精选</> 1 篇带代码🏆 5 篇 SOTA
📈 趋势速览基准测试正从静态指标转向动态、多维度评估,如SWE-Gate强调功能与代码质量并重,Principia测试物理关系。同时,多模态模型向3D世界理解扩展,Puffin-World原生建模3D状态。在线蒸馏研究揭示单样本威力,提示优化关注错误结构。
1
最后的翻译基准
基准评测SOTA
Last Translation Benchmark
💡 翻译基准饱和,亟需新评测方法指引方向。
NLPVilém Zouhar、Niyati Bafna、Mukund Choudhary
2
SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents
💡 软件工程智能体需通过代码审查,评测更全面。
大模型Xin He、Yanlin Wang、Mingwei Liu
3
Principia: Relational Physics Tests for Video Models
💡 视频模型物理推理新基准,测试关系一致性。
多模态Varun Varma Thozhiyoor、Shivam Tripathi、Venkatesh Babu Radhakrishnan
4
Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
💡 高效多参考位姿查询,解决长视频重建漂移。
视觉Chin-Yang Lin、Yang-Che Sun、Cheng Sun
5
💡 VLM引导事件发现,提升弱监督视频描述。
大模型Ye-Chan Kim、Seunghee Choi、SeungJu Cha
6
Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
💡 原生3D世界状态,统一多模态模型新范式。
多模态Kang Liao、Yihang Luo、Xiao-Ming Wu
7
ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize
💡 错误结构提示优化,解决膨胀问题。
NLPLihao Liu、Peng Tang、Kunwar Yashraj Singh
8
💡 无需训练统一视频编辑,多范式支持。
视觉Adheesh Sunil Juvekar、Onkar Kishor Susladkar、Kiet A. Nguyen
9
A Computationally Feasible Framework for Causal Probabilistic Explanation
💡 因果概率解释计算可行,弥合理论与应用。
AI综合Rafal Urbaniak、Sam Witty、Daniel Waxman
10
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
💡 单条样本即可蒸馏,挑战数据规模假设。
NLPZixuan Fu、Bingxiang He、Yuxin Zuo

生成于 15 小时前 · 来源 arXiv · AI 编排

往期日报