← 最新论文日报
9月5日· 周六
arXiv 论文日报
基准革新与智能体评测
今日论文聚焦基准测试的革新与智能体能力的深度评测。机器翻译基准趋饱和,呼唤新方法;软件工程智能体评测引入代码审查约束。同时,视频模型物理推理与3D重建成为热点,多模态模型向原生3D世界状态迈进。
📄 10 篇精选</> 1 篇带代码🏆 5 篇 SOTA
📈 趋势速览基准测试正从静态指标转向动态、多维度评估,如SWE-Gate强调功能与代码质量并重,Principia测试物理关系。同时,多模态模型向3D世界理解扩展,Puffin-World原生建模3D状态。在线蒸馏研究揭示单样本威力,提示优化关注错误结构。
2
SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents
💡 软件工程智能体需通过代码审查,评测更全面。
大模型
3
Principia:视频模型的关系物理测试
物理推理SOTA
Principia: Relational Physics Tests for Video Models
💡 视频模型物理推理新基准,测试关系一致性。
多模态
4
Scal3R:面向可扩展在线3D重建的高效多相对位姿查询学习
3D重建SOTA
Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
💡 高效多参考位姿查询,解决长视频重建漂移。
视觉
5
💡 VLM引导事件发现,提升弱监督视频描述。
大模型
6
Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
💡 原生3D世界状态,统一多模态模型新范式。
多模态
7
ESPO:基于错误结构的提示优化方法
提示优化SOTA
ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize
💡 错误结构提示优化,解决膨胀问题。
NLP
8
9
因果概率解释的计算可行框架
因果解释
A Computationally Feasible Framework for Causal Probabilistic Explanation
💡 因果概率解释计算可行,弥合理论与应用。
AI综合
10
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
💡 单条样本即可蒸馏,挑战数据规模假设。
NLP
生成于 19 小时前 · 来源 arXiv · AI 编排