2026.08.27 | 双脑记忆让语音助手实时又准确;科学工作流多数模型难善终

2026.08.27 | 双脑记忆让语音助手实时又准确;科学工作流多数模型难善终

16分钟 ·
播放数69
·
评论数0

【赞助商】
OpenClaw快报
每天五分钟,听听 OpenClaw 快报,带你了解最新动态和业内讨论
传送门 www.xiaoyuzhoufm.com

【目录】
本期的 15 篇论文如下:

[00:31] 🧠 VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction(VoiceMem:面向实时交互的流式双脑记忆)
[01:30] 🧪 FrontierChallenge: Evaluating Scientific Workflow Completion(前沿挑战:评估科学工作流完成度)
[02:29] 🎬 VGI-Bench: Probing Visual Intelligence in Video Generation Models(VGI-Bench:探究视频生成模型的视觉智能)
[03:32] 🚀 WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation(WarpSAC:重思探索与利用,迈向可扩展离策略强化学习的巅峰)
[04:27] ⚙ JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution(JIT-Agent:通过即时框架演化实现框架智能的规模化扩展)
[05:20] 🧠 VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning(VBVR-Pro:可扩展且可验证的原生视觉推理套件)
[06:15] 🎛 D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation(D³-MOPD:面向高效多教师蒸馏的自适应动态领域调度)
[07:22] 🧠 Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data(下一块推理强化学习真的比SFT更好吗?重新审视无CoT数据下的训练策略)
[08:26] 🎯 Agent-G$^2$: Gaussian Guidance for Agentic Reinforcement Learning(Agent-G²:面向智能体强化学习的高斯引导)
[09:13] 🎬 Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds(面向持久故事与交互世界的长时程音视频生成)
[10:19] ⚖ Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation(Open-MOPD:多教师同策略蒸馏中能力失衡的诊断与修复)
[11:26] 🤖 StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models(StreamPI:面向视觉-语言-动作模型的流式多模态时序建模)
[12:29] 🎬 Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios(视频-IFBench:评估多模态大语言模型在视频理解场景中的指令跟随能力)
[13:30] 🧠 Code World Model: Coding Agent as World Brain(代码世界模型:代码智能体作为世界大脑)
[14:25] 🎯 V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning(V-Rubrics:基于评分标准的强化学习实现视觉忠实性)

【关注我们】
您还可以在以下平台找到我们,获得播客内容以外更多信息
小红书: AI速递