核心话题
Vercel CEO Guillermo Rauch 在 HF 入侵事件同日发表判断——网络安全是超级智能的最佳基准。
关键观点
SWE-bench 等编码基准可被训练数据污染,但安全基准不行——攻击方没有训练数据,是真正的零样本推理
- MAD Bugs 2026 中 Claude 自主挖出 500+ 零日漏洞,Ghost CMS 20 年未发现的 SQL 注入 90 分钟内被定位
- HF 团队用商业模型分析日志被安全策略锁死,最终用 GLM 5.2 开源权重模型完成取证——AI 防御的「不对称问题」首次被实证
- 独立开发者本周两件事:用 Claude Code Plan Mode 跑认证模块审计;准备一个开源权重 LLM 作为应急取证模型
