2026.08.18 | 智能体化评测让世界模型可诊断;多模态三维生成仍有瓶颈

2026.08.18 | 智能体化评测让世界模型可诊断;多模态三维生成仍有瓶颈

15分钟 ·
播放数59
·
评论数0

【赞助商】
OpenClaw快报
每天五分钟,听听 OpenClaw 快报,带你了解最新动态和业内讨论
传送门 www.xiaoyuzhoufm.com

【目录】
本期的 15 篇论文如下:

[00:32] 🕵 HarnessEval-W: Agentifying the Evaluation of Visual Worlds(HarnessEval-W:使视觉世界的评估智能体化)
[01:32] 🌍 VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?(VibeWorlding:多模态智能体能否端到端构建3D开放世界?)
[02:10] ⚡ MOSS-VL Technical Report(MOSS-VL 技术报告)
[03:05] 🤖 ClawGym II: Exploring Black-Box RL on Agent Harness(ClawGym II:在智能体框架上探索黑盒强化学习)
[03:56] 🎯 Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization(学习尚未掌握的,而非已经精通的:面向多奖励策略优化的饱和感知优势重加权)
[04:51] 🤖 UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations(UI-Mate:利用上下文演示推进开放权重的基础图形用户界面智能体)
[05:46] 🔬 Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search(大型发现模型:基于经验建模的开放式搜索)
[06:37] 🎨 An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models(训练像素空间文本到图像扩散模型的实证研究)
[07:31] 🤖 Agentic Transaction: Towards ACID-Compliant Agent Systems(智能体事务:迈向ACID合规的智能体系统)
[08:29] 🔬 How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks(智能体如何在自动研究中失败:基于100个真实前沿研究任务的端到端诊断评估)
[09:24] ⚡ GenRouter: Unified Workflow Routing for Agentic Image Generation(GenRouter:用于智能体图像生成的统一工作流路由)
[10:29] 🧩 MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling(MegaParts:通过词元高效的自回归建模将部件感知的3D物体生成扩展到300个部件)
[11:22] 🧠 Understanding Cognition-Induced Risks in Agentic AI Systems(理解智能体AI系统中认知引发的风险)
[12:21] 🔗 Advancing Open and Reproducible Relational Learning: RelArena-$α$, TabPFN-Rel and RPI(推进开放可复现的关系学习:RelArena-α、TabPFN-Rel与RPI)
[13:24] 🛡 Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs(Ventor-QTest:威胁模型驱动的供应商托管LLM API验证)

【关注我们】
您还可以在以下平台找到我们,获得播客内容以外更多信息
小红书: AI速递