2026.08.11 | 自进化混合专家赋能持续学习;代码重构基准揭示智能体局限

2026.08.11 | 自进化混合专家赋能持续学习;代码重构基准揭示智能体局限

15分钟 ·
播放数54
·
评论数0

【赞助商】
OpenClaw快报
每天五分钟,听听 OpenClaw 快报,带你了解最新动态和业内讨论
传送门 www.xiaoyuzhoufm.com

【目录】
本期的 15 篇论文如下:

[00:30] 🔄 Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA(Macaron-V1:迈向具备自我改进和LoRA混合的开放持续学习)
[01:24] 🔧 SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring(SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准评测)
[02:21] 🐍 Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution(Ouroboros:通过核心评审进化实现自我发展的前沿编程智能体)
[03:31] 🧠 BDH-CQ: In-Context Learning with Recurrent Latent Reasoning(BDH-CQ:基于循环潜在推理的上下文学习)
[04:13] 🧠 Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory(智能体记忆蒸馏:利用分层教师记忆赋能小型大语言模型智能体)
[05:11] 🧠 Motif 3: Technical Report(Motif 3:技术报告)
[05:59] 🔬 Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains(Sci-VBench:评估科学领域中知识与推理密集型视频生成)
[06:49] 🖼 What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems(下一步编辑什么:对话系统中的视觉对齐图像编辑后续建议)
[07:53] 🎯 SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation(SPOT:面向同策略蒸馏的稀疏探测与结果校准)
[08:58] ⚡ OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching(OasisKV:通过前瞻稀疏预取将解码期KV缓存扩展到HBM之外)
[09:49] 🧠 RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States(RoMeRL:通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱)
[10:43] 🔍 Evidence-RL: Towards Evidence-intensive Visual Reasoning(证据强化学习:迈向证据密集型视觉推理)
[11:42] 🧠 Scaling Inherently Interpretable Language Models(扩展内在可解释的语言模型)
[12:40] 🧬 Evo-Bench: Can Language Models Improve Agent Harness?(Evo-Bench:语言模型能否改进智能体运行框架?)
[13:40] 🔓 Stealing Reasoning Traces from Proprietary LLM APIs(从专有大语言模型API中窃取推理轨迹)

【关注我们】
您还可以在以下平台找到我们,获得播客内容以外更多信息
小红书: AI速递