【赞助商】
OpenClaw快报
每天五分钟,听听 OpenClaw 快报,带你了解最新动态和业内讨论
传送门 www.xiaoyuzhoufm.com
【目录】
本期的 15 篇论文如下:
[] 🧠 Kimi K3: Open Frontier Intelligence(Kimi K3:开放前沿智能)
[] 🎨 JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents(JarvisHub:一个面向画布原生多模态创意代理的开放框架)
[] 🤖 From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search(从专有到开源:通过多智能体协议蒸馏弥合智能搜索中的分布差距)
[] 🤖 Progress Reward Modeling for Robotic Learning: A Comprehensive Survey(机器人学习的进度奖励建模:一项全面综述)
[] 🤖 StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents(StateAct:面向长周期计算机使用代理,程序状态优先于像素)
[] 🧠 Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation(重新思考在线策略扩散蒸馏中的无分类器引导)
[] 🗼 Data Pyramid for Embodied Manipulation(具身操作的数据金字塔)
[] ⚡ Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification(Sol-Attn:通过即时注意力稀疏化加速视频生成推理)
[] 🎬 OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation(OmniVAE:一种具有跨模态对齐的音频-视频VAE,用于联合生成)
[] 🧠 The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation(多轮长程规划中的物理学:通过单教师与多教师在线策略智能体蒸馏从预训练到后训练)
[] 👗 Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On(氧气试穿:面向时尚的原生基础模型,实现任意物品虚拟试穿)
[] 🦎 Chamaileon: Cross-Context Binder Design with Contextualized Modeling and Mixed Sampling(Chamaileon:基于情境化建模与混合采样的跨情境结合剂设计)
[] 🔮 dRAE: Representation Autoencoder with Hyper-Spherical Codes(dRAE:超球面码的表示自编码器)
[] 🧩 DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes(解耦混合:用于可扩展VLM数据配方的解耦比率搜索与凸分配)
[] 🏥 ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding(ClinFusion:一种面向整体医学理解的以视觉为中心的多模态大语言模型系统)

【关注我们】
您还可以在以下平台找到我们,获得播客内容以外更多信息
小红书: AI速递
