2026.07.21 | 时间定位与高效剪枝;两篇论文提升模型精准度与效率

2026.07.21 | 时间定位与高效剪枝;两篇论文提升模型精准度与效率

15分钟 ·
播放数49
·
评论数0

【赞助商】
OpenClaw快报
每天五分钟,听听 OpenClaw 快报,带你了解最新动态和业内讨论
传送门 www.xiaoyuzhoufm.com

【目录】
本期的 15 篇论文如下:

[00:31] ⏱ TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs(TimeLens2:基于多模态大语言模型的通用视频时间定位)
[01:14] ✂ SWE-Pruner Pro: The Coder LLM Already Knows What to Prune(SWE-Pruner Pro:编码器大语言模型已知道该剪枝什么)
[02:05] 🌍 EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World(演化世界:面向交互式文学世界中角色与世界观协同演化的开放模式框架)
[03:08] 🔍 DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment(DeepSearch-World:可验证环境中深度搜索代理的自我蒸馏)
[04:06] 🎬 HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement(HOMIE:通过多模态智能增强实现以人-物为中心的视频个性化)
[04:59] 🤖 RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model(RynnBrain 1.1:迈向更强大和更通用的具身基础模型)
[05:51] 🍎 Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence(苹果-π:面向法律约束的物理智能,以视频为基准测试思维过程)
[06:49] 🎯 Group Entropy-Controlled Policy Optimization(群体熵控制策略优化)
[07:52] 🧠 ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams(反射世界-多模态:面向开放视频流的实体导向多模态记忆系统)
[09:03] 🌍 GigaAM Multilingual: Foundation Model for Underrepresented Languages(GigaAM多语言模型:面向低资源语言的基座模型)
[09:51] ⏱ GigaChat Audio: Time-aware Large Audio Language Model(GigaChat音频:时间感知的大规模音频语言模型)
[10:50] 🤖 Environment-free Synthetic Data Generation for API-Calling Agents(面向API调用智能体的无环境合成数据生成)
[11:42] 🎬 FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry(FlowMimic: 基于像素对扭曲流场的无掩码视觉编辑与生成——用于在线视频编辑数据生成与模态模仿)
[12:30] 🧊 DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation(DiffGI:面向高保真薄壳三维生成的可微几何图像)
[13:20] 🎓 LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks(LLM作为教练:非可验证任务的体验式学习)

【关注我们】
您还可以在以下平台找到我们,获得播客内容以外更多信息
小红书: AI速递