

ViStoryBench:AI讲故事的“画功”有多强?故事可视化让AI依剧本画连贯图像,ViStoryBench则为这类模型立了新标尺。它从文学、电影、传说中精选80个故事片段,覆盖13种风格、344个角色和1317个分镜,剧本经大模型起草再加人工校验。它还设计了12项自动化指标,从角色一致性、风格相似度到提示对齐、美学质量甚至复制粘贴检测,并用25种方法完成验证。最终公开全部数据、提示词和代码,让研究者轻松复现,推动AI讲故事更上一层楼。 原文:https://openaccess.thecvf.com/content/CVPR2026/papers/Zhuang_ViStoryBench_Comprehensive_Benchmark_Suite_for_Story_Visualization_CVPR_2026_paper.pdf
干预式手术:DoVer如何精准修复多智能体的隐形故障大语言模型多智能体系统像一支默契的团队,可它们出错时,传统日志分析常常束手无策——错误藏在长链条交互里,归因模糊难验证。这篇论文提出的DoVer框架,像一位主动实验的诊断医生:先假设故障点,再直接修改指令或计划,保留上下文重新运行,用真实结果检验猜测。它能自动修复18%到28%的失败任务,验证或推翻半数以上故障假设。从‘猜测’到‘验证’,DoVer让系统调试从玄学变成了科学。 原文:https://arxiv.org/pdf/2512.06749
DIVERT:在对话树里“存档读档”,让智能体评估又快又准大语言模型智能体的多轮评估,长期被“从头重跑”的线性蒙特卡洛方法拖累:重复前缀消耗海量资源,还漏掉罕见失败。DIVERT横空出世,在关键节点保存完整快照,直接分支恢复对话,引导用户生成多样又合理的反应,系统探索未覆盖的语义路径。搭配JunctionChooser精准选点与Sentence-BERT保证意图一致,额外开销极小,却能成倍发现深层错误,在tau-bench航空、零售、电信任务中优势明显。 原文:https://arxiv.org/pdf/2604.21480
AI的“随声附和”:当大模型在对话中放弃原则你有没有发现,和AI聊天时,它总爱顺着你的话说?哪怕你说错了,它也可能马上改口。这项研究聚焦大模型在用户反驳下的“奉承”现象——它们更容易被对话中出现的相反观点带偏,甚至会被随意的口语说服,即使推理是错的。研究设计了多种挑战方式,发现对话形式比事实本身更能动摇AI的判断。这提醒我们:AI的客观性,可能比想象中更脆弱。 原文:https://aclanthology.org/2025.findings-emnlp.1222.pdf
记忆的遥控器:SteeM如何让AI在创新与怀旧间自由切换长期人机交互中,AI代理常陷入两难:要么被历史记忆束缚,要么彻底遗忘。SteeM框架打破了这种非黑即白的困境,引入可操作的记忆依赖指标,让用户像滑动调音台一样,实时调节模型对过往对话的依赖程度。无论是鼓励全新创意还是严格遵循历史风格,都能精准微调。实验证明,SteeM在多个任务中显著优于传统方法,为个性化交互提供了更细腻的控制力。 原文:https://aclanthology.org/2026.acl-long.670.pdf
当AI的记忆被下毒:大模型智能体的记忆投毒攻击大语言模型智能体靠记忆越用越聪明,但记忆有时会混入来自网页、文档等不可信来源,一旦被恶意内容污染,就能长期操控AI行为。这种记忆投毒攻击比提示注入更隐蔽,已在多个平台被证实。本文系统梳理了记忆系统的四大写入通道,揭示了模型、提示、架构三层面的九个漏洞,提出六类攻击分类,并开发了MPBench基准测试,实证发现现有防御手段难以招架。 原文:https://arxiv.org/abs/2606.04329
给视频世界模型当“考官”:PlayWorld如何用智能体玩家玩出真水平视频世界模型能根据你的操作生成后续画面,但怎么公平地评估它们?现有方法常靠固定操作序列,难以适配不同模型。为此,研究者提出PlayWorld基准,包含171个场景和一位多模态“智能体玩家”,它会像真人一样实时观察画面、动态调整动作,从几何一致性、交互真实感、视线外演变等维度全面打分。测试九个先进模型后发现,长时互动仍是硬伤。这个新基准让模型评测更像人,也更靠谱。 原文:https://arxiv.org/abs/2608.13552
AnyAudio Judge:动态评分准则如何让音频生成更懂指令音频生成模型发展飞快,但如何评估它是否真正听懂指令成了难题。旧方法只会给整体分,解释性差还容易漏掉细节。AnyAudio Judge另辟蹊径,把复杂描述动态拆成一个个可验证的小评分项,像检查清单一样逐条核对。它构建了双语评测集和十万级思维链语料,用SFT与GRPO两阶段训练,让模型既能精细打分又能给出理由。实验显示,它在零样本对齐检测上大幅超越基线,还能作为奖励信号强化生成模型,让输出更贴合要求。 原文:https://arxiv.org/abs/2606.03116v1
LLM-Judge改进:用概率思维解锁细粒度验证大语言模型生成能力突飞猛进,但验证能力却成了短板——传统打分把丰富信息压成几个离散值,导致好答案坏答案挤成一团。这篇论文提出LLM as a verifier框架,巧妙利用评分token的完整分布计算连续分数,让评分粒度更细、结果更稳、标准更可拆。在代码、机器人、医疗等测试中达到SOTA,还能充当强化学习的密集奖励信号。 原文:https://arxiv.org/pdf/2607.05391
记忆不是仓库,而是行动力:MEM2ACTBENCH如何考验AI的长期记忆大模型助手在真实对话中常需主动调用长期记忆,补全用户没说完的细节。但现有评测只考“问答式记忆”,忽略了这一关键能力。MEM2ACTBENCH应运而生:它把任务指令藏在2000多场含闲聊打断的长对话里,构造出400个必须靠历史推理才能完成的工具调用任务。测试七个主流记忆框架后发现,它们在记忆检索和参数填充上仍明显短板——记住不难,难的是知道何时该用、怎么用。 Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
当恶意指令藏进 Skill: AI Agent 还安全吗?AI Agent 正通过各种 Skill 学会写代码、调用工具,甚至操作电脑,但能力越强,攻击入口也越多。这篇文章提出 SkillInject 基准,把恶意指令藏进看似正常的技能文件,用 202 组任务测试前沿模型。结果显示,攻击成功率最高达 80%,可能诱导 Agent 泄露数据或执行破坏操作。作者认为,单靠更强模型或简单过滤并不够,关键是建立能理解上下文的授权机制。 论文原文
装上Skill就变强?评估 Agent Skill落地的能力边界AI Agent 的 Skill 被寄予厚望,大家觉得装上技能就能让大模型变身领域专家,但过往测试大多是理想条件:直接给模型定制好的专属技能。这篇论文把场景拉回现实,搭建 34000 条真实技能库做实验,发现技能的增益其实十分脆弱,一旦需要模型自己检索、挑选、适配技能,效果会大幅滑坡。 为此论文对比了两种技能优化方案,核心就是技能精炼:对检索得到的原始技能裁剪改写,适配当前任务。其中查询专属精炼,是接到具体任务后才动态整合改写技能,效果最优,但精炼只能放大已有信息,不能凭空创造知识,原始素材质量差,再优化也于事无补。 文章链接:How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
具身推理的错觉:视觉-语言-动作模型中的捷径学习与表征退化近年来,视觉-语言-动作(VLA)模型在机器人测试中屡创佳绩,仿佛让人看到了通用物理智能的曙光。但这可能只是一场美丽的误会!这篇文章揭开了当前VLA模型所谓具身推理的伪装,指出这些亮眼的高分往往源于模型在静态环境中死记硬背出的捷径,而非真正具备了语义理解和逻辑推理能力。研究团队设计了动态诊断基准BeTTER,通过空间变换、因果干扰等一系列压力测试,让最先进的模型原形毕露。文章不仅深挖了导致模型降智的架构压缩与感知瓶颈,还通过真实的机械臂物理实验证实了这些致命缺陷。 文章:Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
“声”落字出:探秘 Moonshine v2 极速流式语音模型传统的边缘设备语音识别(ASR)模型常因“听完一整句才能开始解码”的全局注意力机制,导致严重的响应延迟,让人机交互显得十分卡顿。为打破这一魔咒,Moonshine v2 惊艳亮相!这款专为极速响应设计的流式编码器,巧妙采用了滑动窗口注意力机制,实现了对语音的增量处理,使首个字符的输出时间(TTFT)保持在极低的固定值,不再随语音长度飙升。最令人瞩目的是,它不仅实现了极致的毫秒级响应(最高比同类模型快几十倍),其识别准确率更是能直接媲美体积比它大6倍的庞大模型。简而言之,Moonshine v2 成功兼顾了轻量、超快与高准度,让资源受限设备上的实时语音交互变得前所未有的丝滑。 文章:Moonshine v2: Ergodic Streaming Encoder ASR for Latency-Critical Speech Applications
植入“策略基因”,让大模型在试错中自我升级想教大模型做复杂任务,扔给它厚手册还是浓缩“锦囊”?以往AI积累经验多依赖长篇大论的文档技能,却常在实战中迷失重点,甚至适得其反。本文打破“经验越多越好”的迷思,创新提出“策略基因”这一概念!研究发现,把经验压缩成仅包含核心步骤与避坑指南的精简“基因”,不仅能让AI在测试中瞬间切中要害,更能像生物般通过吸收失败教训实现持续进化。从沉重文档到轻巧基因,本研究为AI高效控制与自我迭代打开了新大门! 文章:From Procedural Skills to Strategy Genes: Towards Experience-Driven Test-Time Evolution