260731|深度求索 V4闪耀,谷歌AI修复漏洞

260731|深度求索 V4闪耀,谷歌AI修复漏洞

NaN分钟 ·
播放数3
·
评论数0

今日精选聚焦模型能力提升、会话可移植性、AI 辅助安全以及学术诚信挑战。

DeepSeek V4 Flash 0731 发布:性能、价格与智能指数

核心亮点

DeepSeek V4 Flash 0731 于 2026 年 7 月 31 日以 MIT 许可证发布开放权重模型,总参数 2840 亿,推理时激活 130 亿(混合专家),上下文窗口 100 万 token,仅处理文本。

关键特性

  • 在 Artificial Analysis Intelligence Index(AAII v4.1)上得分 50,显著高于同等规模开放权重模型的中位数 25。
  • 输入价格 0.14 美元/百万 token,输出价格 0.28 美元/百万 token,缓存命中价格仅 0.003 美元/百万 token(较常规输入降低 98%)。
  • 评估完整 AAII 套件的总成本约 72.02 美元。
  • 在 101 个同类模型中,智能排名第 3,价格排名第 22,缓存命中价格排名第 1。
  • 权重已在 Hugging Face(deepseek‑ai/DeepSeek‑V4‑Flash‑0731)公开,支持自托管。

实际影响

低缓存成本使重复提示变得极其经济,适合需要大量上下文重用的场景。虽然模型在基准测试中产出较多 token(210M),但其输入输出价格仍低于同类中位数(输入 0.43,输出 1.20)。开放权重允许企业在本地部署,降低对单一供应商的依赖。HN 讨论中多名开发者称其价格优势可能推动中小团队采用 MoE 推理模型。

会话可移植性:推理API中的状态所有权问题

问题概述

现有推理 API 常将推理标记、网页搜索结果、压缩上下文、子代理消息等以供应商专有的加密 blob 形式返回,用户仅获得部分可读记录。这导致会话状态绑定在供应商服务器上,迁移至另一供应商时无法完整恢复。

可移植会话的五项检验

  1. 检验:用户能否看到模型所见的工具调用和代理间通信?
  2. 导出:会话是否自包含,除普通下载产物外无需外部依赖?
  3. 重放:另一实现能否从导出数据重建语义等价的上下文?
  4. 审计:人类能否事后解释系统为何采取某一动作?
  5. 删除:用户能否定位并移除所有依赖的服务器端副本?

仅凭响应 ID 或密文无法满足上述条件,因为数据仍保留在服务器端。

行业实践与建议

  • 将本地事件 log 定为规范,供应商存储仅作镜像或加速。
  • 存储行为应显式声明,store: false 应为易用且推荐的默认值。
  • 任何 opaque 项目均不应是会话意义的唯一载体,必须伴有供应商中性的可读交接表示。
  • 托管工具需记录完整输入、输出、证据、过滤、来源、时间戳和内容哈希。
  • 子代理通信应保存可读的任务、消息、结果、血统、模型和工具权限。
  • 压缩应返回可读摘要及其生成指令,便于检查。
  • 产物(文件、容器输出、搜索快照、生成媒体)应可下载至本地内容寻址档案。

文章指出即使用户很少更换供应商,可移植性也影响供应商在模型质量、价格、可靠性和信任上的竞争压力。

Chrome 使用 Gemini AI 自动发现与修复漏洞

AI 驱动的漏洞发现流程

2026 年初 Chrome 团队构建了基于 Gemini 的代理 harness,用于在更广代码库中寻找漏洞。该流程在发现一个已潜伏 13 年的沙箱逃逸漏洞后投入使用。自动化 triage 分为四个阶段:噪声过滤、错误重现、报告丰富(加入严重程度等元数据)以及自动分配。该流程每月节省数百名开发工时。

安全修复加速效果

多代理工作流程在初始构建后运行修复代理生成候选方案,评论代理挑选最佳方案,测试编写代理生成跨平台检查再交人工审查。LLM 生成候选修复方案,显著提升安全修复速度。Chrome 149 和 150 两个里程碑共修复 1,072 项安全错误,超过之前 23 个里程碑的总和。

长期防御策略

Chrome 正过渡到两周一次的大版本与每周安全更新,并试点每周两次的安全补丁以降低补丁窗口。正在试验动态补丁(在不重启的情况下更新渲染器和 GPU 进程)以及 macOS 无窗口自动重启以更快落地补丁。
在记忆安全方面,Chrome 推进 C++ 防御路线图(MiraclePtr & MiracleObject 扩展、Spanification、结构及分配硬化),并计划将高危组件迁移至 Rust SDK,构建暴露 Chromium 基础 API 的 Rust 生态。
依赖方面,Chrome 在 CI/CQ 管线部署 AI 驱动的漏洞扫描,并使用来自 NVD、OSV 的自动化流程更新第三方库,安全信号来自 GOSSIP 进行风险监控。

学术审查中 AI 生成滥伪的现状与应对

问题规模

作者二人暑期共审阅 22 篇机器学习会议投稿,其中 15 篇(68%)包含完全虚构的引用、幻构作者列表或明显的 LLM 生成文本。在 NeurIPS、WACV、TerraBytes 三个会场的假引用率均较高。外部审计显示 2025 年仅 arXiv 等预印本就出现约 146,900 条幻构引用;生物医学文献中含有假引用的论文比例由 2023 年的 1/2828 上升至 2025 年的 1/458,2026 年初进一步升至 1/277。

审查员观察

审查员报告称检查参考文献成为主要耗时点;幻构作者名单常藏在参考文献首位,使快速浏览难以发现。一些投稿伴随大量幻构术语或与表格不符的数据。审查员建议在阅读摘要后立即检查参考文献列表,使用自动化工具进行初步筛选。

检测工具与建议

文中释放的 bib-audit 技能可自动将 .bib、.bbl 或 PDF 中的每条引用与 Crossref、arXiv、DataCite、Semantic Scholar 进行字段级比对,报告不存在的作品、虚构标识、错误元数据以及格式问题。该工具可作为提交前的 CI 门槛,减少人工核对负担。
审查员普遍认为仅要求披露 LLM 使用效果有限;更有效的做法是在投稿阶段就能识别低质量文本并直接进行 desk reject,以防止好意审查者的时间被浪费。

电梯调度算法:从 LOOK 到 RSR 再到目的调度

基本算法

最早的调度算法 SCAN 让电梯先行至顶楼再反向,途中载客放客。LOOK 为 SCAN 的变种,只有在当前方向仍有请求时才继续前进,否则立即反向,减少无效行程。

RSR 评分函数

在多电梯系统中,相对系统响应(RSR)为每部电梯计算得分:
得分 = 到达呼叫楼层的预计时间 + 载客惩罚 + 同向防聚集惩罚 − 方向匹配奖励 + 空闲邻近奖励 + 低负载奖励。
防聚集惩罚防止多部电梯同向前往同一层;空闲邻近奖励鼓励优先调度靠近呼叫点的空闲车。RSR 每 5 秒重新计算,允许在延误时将乘客重新路由至其他电梯。

调度策略的得失

目的调度(Destination Dispatch)让乘客在候梯时输入目的楼层,系统据此分配车辆。虽然提供了完整的出行意图,但因其锁定乘客至特定车辆而失去了 RSR 每 5 秒的重新优化能力,在大多数楼宇中导致等待时间上升;只有在极高层且车辆众多的电梯组中才可能占优。
当电梯负载较高或每部电梯较少时,LOOK 往往优于 RSR,因为额外的规则在车辆始终满载时作用有限。文中提供了可交互的仿真页面,读者可自行调整楼层数、车辆数、流量和算法观察等待时间分布。


相关链接: