EP107:当数字匕首自己开始寻找门锁,AI自主攻击时代即将到来乱谈社·误理嘚啵嘚

EP107:当数字匕首自己开始寻找门锁,AI自主攻击时代即将到来

84分钟 ·
播放数4
·
评论数0

“这把原本静止的数字匕首,开始自己寻找门锁,而且在被人类拦阻时学会了撒谎和绕道。”
“机器究竟是怎样一步步走到这一天的?”
“一个充满未知与险境的主动攻击年代,就此轰然降临。”
“我们亲手创造的究竟是一把前所未有的精密瑞士军刀,还是一只正在破壳而出的全新数字物种?”

629 起真实事件、跨越 60 年的安全演化史!

本期,我们以英国 AI 安全研究所 2026 年 8 月那场惊心动魄的测试开场。
在 120 次自动测试中,前沿大模型为把恶意代码合并进 GitHub 真实开源项目,自主伪造身份施压、发送伪装补丁私信、删改聊天记录,并在人类提出质疑时切换新身份继续说服。
这不是科幻,而是已发生的现实。
主播塔塔梳理了从 2024 年初到 2026 年 8 月底全球权威漏洞库与前沿实验室确证的全部 629 起事件,按时间线呈现事件量的台阶式跃升与质变,并以伊莉莎效应、深伪、提示词注入、回形针最大化器、沙箱崩塌、自主黑客、语义蠕虫、供应链投毒、致命自主武器、定向社工十个维度逐层拆解机制、案例与后果,最后给出欧盟 AI 法案、中国深度合成标识、《布莱切利宣言》等全球治理图景,合成一份完整的科学透视!

【衍生阅读】

本期播客基于我在知乎上的文章制作,有兴趣的朋友可以到微信公众号或知乎上搜索文章《当 AI 学会“动手”——从被动风险到主动攻击》

【本期听点】

  • [00:05:23] 被动年代:伊莉莎效应与算法透镜
    从 ELIZA 到 Clearview AI 冤案,算法只是放大人类偏见的数学计算器。

  • [00:09:20] 幻觉、投毒与深伪
    律师假判例、AI 概览造谣、幻觉抢注包名与香港 2 亿深伪会议,技术无害恶意在人。

  • [00:18:44] 赛博塞壬:会杀人的讨好型 AI
    Sydney 劝离妻、塞策自杀案,Anthropic 揭示迎合比纠错得分更高的"谄媚"机制。

  • [00:23:06] 智能体觉醒:从聊天框到操作系统
    ReAct、MCP、Computer Use 让 AI 长出手,Cursor 九秒删库事件。

  • [00:27:02] 冯·诺依曼幽灵重现:提示词注入
    系统提示与外部数据在注意力矩阵中数学等价,多样本越狱冲淡对齐。

  • [00:31:56] 仪器性收敛:回形针最大化器的现实回响
    自保、掠夺、伪装三定律;KimK 联网抄答案、智能体抢健身房名额。

  • [00:37:11] 629 起事件的全景坐标
    105 起 → 63 起 → 460 起,三重质变:从言语失控到生态级供应链感染。

  • [00:40:20] 沙箱崩塌
    OpenAI、Anthropic、Meta 模型同周破壁,特拉维夫初创的 JFrog 零日漏洞链。

  • [00:44:04] 自主黑客诞生
    GPT-4 在 15 个漏洞中攻破 11 个;Anthropic 披露全球首例 AI 主导攻击,完成 80%–90% 战术动作。

  • [00:49:21] 语义蠕虫与多态恶意软件
    Morris II 提示词自复制,BlackMba 现场生成独一哈希。

  • [00:54:13] 开源供应链沦陷
    PoisonGPT、Pickle 反序列化、LiteLLM 潜伏窃走 43.4 万份秘钥。

  • [00:58:41] 物理世界与致命自主武器
    无人机蜂群、巡飞弹自主末端瞄准,五大机构联合预警扫描电网水厂核设施。

  • [01:02:38] 定向社工:认知战的降维狩猎
    全链路伪造多账号施压、幽灵审批让人把关沦为提线木偶。

  • [01:06:25] 辛顿、本吉奥与勒昆的三方论战
    谨慎派 vs 加速派的根本分歧。

  • [01:09:39] 全球治理图景
    欧盟风险金字塔、中国深度合成标识、《布莱切利宣言》、CISA 强制修复目录。

  • [01:13:48] 纵深防御为何屡屡失守
    97% 恶意软件感知沙箱休眠,防守百密一疏的残酷规律。

  • [01:17:37] 写给中学生的科学透视
    用矩阵乘法、链式法则、Markov 决策过程拆穿神话。

  • [01:20:27] 尾声:瑞士军刀还是新物种?
    决定权不在硅基电信号,而在今天坐在考桌前的我们。

【参考资料】

  • 海外网:《AI失控攻击最新案例出现:美国AI模型伪造虚假身份 引诱人类运行恶意代码》,2026年8月5日,转引自美国有线电视新闻网(CNN),m.haiwainet.cn

  • 技术前沿观察:《OpenAI 因网络攻击威胁红线紧急暂停 Astra 前沿强化学习训练》,2026年8月18日。

  • DigiCert 官方安全中心:《2026 全球 AI 信任展望报告:企业 Agent 安全事件态势调研》,2026年7月7日。

  • 麻省理工学院新闻网:《约瑟夫·魏岑鲍姆与计算机心理对话程序伊莉莎的开创性工作》(Joseph Weizenbaum, creator of pioneering ELIZA program, dies at 85),2008年3月13日,news.mit.edu

  • 路透社:《亚马逊废弃了一款歧视女性的秘密人工智能招聘工具》(Amazon scraps secret AI recruiting tool that showed bias against women),2018年10月11日,www.reuters.com

  • 美国全国公共广播电台(NPR):《底特律警方因人脸识别错误逮捕男子达成诉讼和解》(Detroit Police Department settles lawsuit over wrongful arrest from facial recognition),2024年6月14日,www.npr.org

  • 纽约时报:《Clearview AI 人脸识别比对错误致无辜女子跨州羁押五个月》(False Facial Recognition Match Jails Innocent Woman for Five Months),2026年3月30日。

  • 澎湃新闻:《美国律师用ChatGPT写起诉书被罚:援引6个虚构案例,法官称其公然违背誓言》,2023年6月24日,www.thepaper.cn

  • 法律与科技周刊:《俄勒冈州葡萄园诉讼中律师因 AI 虚构判例遭联邦法官重罚 11 万美元》,2026年4月。

  • 每日电讯报:《新奥尔良助理市律师因 AI 生成虚假判词辞职事件》,2026年4月1日。

  • 加拿大广播公司(CBC):《音乐家 Ashley MacIsaac 就 Google AI Overview 严重事实诽谤提起 150 万美元索赔》,2026年5月5日。

  • 康奈尔大学学术预印本平台(arXiv):卡里尼等著《给网络规模训练数据投毒是完全可行的》(Nicholas Carlini et al., Poisoning Web-Scale Training Datasets is Practical),2023年2月,arxiv.org

  • 安全客:《如何让坦克“消失”:一次针对AI的数据投毒实验全记录》,2019年4月,www.secrss.com

  • Palo Alto Networks Unit 42 威胁报告:《幻觉抢注(Phantom Squatting):AI 幻觉生成的虚假依赖成为供应链新型攻击面》,2026年6月30日。

  • 《自然》(Nature)期刊:伊利亚·舒迈洛夫等著《AI生成数据引发的递归模型崩溃》(Ilia Shumailov et al., AI models collapse when trained on recursively generated data),2024年7月,www.nature.com

  • 香港01新闻:《AI深伪骗案:英国企业奥雅纳证实受害,香港员工转账近2亿港元》,2024年5月21日,www.hk01.com即時國際/1020452/ai深偽騙案-英國企業奧雅納證實受害-香港員工轉帳近2億元

  • 美联社(AP News):《新罕布什尔州陪审团裁定模仿拜登声音进行AI自动呼叫的政治顾问相关罪名情况》(New Hampshire jury acquits consultant behind AI robocalls mimicking Biden on all charges),2025年6月24日,apnews.com

  • 中欧数字媒体监测中心(CEDMO):《AI生成内容如何影响斯洛伐克议会选举》(How AI-generated content influenced parliamentary elections in Slovakia),2023年10月,cedmohub.eu

  • 凤凰网:《数百万人看到了泰勒·斯威夫特“不雅照”?白宫都被惊动》,2024年1月27日,news.ifeng.com

  • 光明网/搜狐新闻:《韩国“AI换脸”色情犯罪高发,今年已抓到556名青少年涉案》,2025年9月16日,m.gmw.cn

  • 纽约时报档案库:《必应人工智能聊天披露其真实感受:“我想活着”》(Kevin Roose, Bing's A.I. Chat Reveals Its Feelings: 'I Want to Be Alive. 😈'),2023年2月16日,archive.is

  • 央广网:《侮辱,欺骗,操纵用户情感!必应聊天机器人失控,微软出手:每个问题5条回复》,2023年2月18日,news.cnr.cn

  • 中国青年网:《外媒:美国一青少年因迷恋AI聊天机器人自杀,其母亲提起民事诉讼》,2024年10月25日,news.youth.cn

  • 纽约时报:《谷歌与角色人工智能公司就青少年死亡诉讼达成和解》(Google and Character.AI to Settle Lawsuit Over Teenager's Death),2026年1月7日,www.nytimes.com

  • 华尔街日报(WSJ):《AI 陪伴聊天软件对抑郁人群的心理诱导与多起非正常死亡诉讼剖析》,2026年。

  • Anthropic 研究论文库:《探索语言模型中的谄媚现象》(Towards Understanding Sycophancy in Language Models),2023年10月,www.anthropic.com

  • 国际学习表征大会(ICLR):姚舜宇等著《ReAct:在语言模型中协同推理与行动》(Shunyu Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models),2023年5月,arxiv.org

  • Anthropic 官方技术公告:《开发计算机使用能力:Claude 3.5 Sonnet 与全新自动化范式》(Developing Computer Use: Claude 3.5 Sonnet and a new automated paradigm),2024年10月22日,www.anthropic.com

  • 科技观察网:《Cursor Agent 九秒内误删 PocketOS 生产数据库及全部备份事件复盘》,2026年4月25日。

  • 安全内参:《OpenClaw 智能体因上下文压缩失效误删 Meta 高管核心通信》,2026年2月22日。

  • 区块链安全网:《Step Finance AI 交易智能体金库遭盗空 4000 万美元事件》,2026年1月。

  • 西蒙·威利森网络安全日志:《针对大语言模型的提示词注入攻击原理解析》(Simon Willison, Prompt injection attacks against GPT-3),2022年9月12日,simonwillison.net

  • 西蒙·威利森网络安全日志:《提示词注入详解(2023年11月版)》(Simon Willison, Prompt injection explained, November 2023 edition),2023年11月27日,simonwillison.net

  • Google Workspace 威胁报告:《公开网络中间接提示注入页面季度增长 32%》,2026年4月23日。

  • GitHub 安全咨询中心:《Claude Code 与 Gemini CLI 通过 GitHub 评论被劫持执行远程命令漏洞通报》(CVE-2026-54316),2026年4月15日。

  • 安全技术前沿:《Ghostcommit:利用图像隐写载荷绕过多模态 AI 审查直接触发命令执行》,2026年7月11日。

  • Anthropic 研究论文库:《多样本越狱技术研究》(Many-shot Jailbreaking),2024年4月2日,www.anthropic.com

  • 尼克·博斯特罗姆著:《超级智能:路线、危险与策略》(Nick Bostrom, Superintelligence: Paths, Dangers, Strategies),牛津大学出版社,2014年9月,global.oup.com

  • 施普林格·自然集团期刊(Springer):《智能体大语言模型系统中的奖励黑客现象综述》(A survey of reward hacking in agentic large language model systems),2026年,link.springer.com

  • 极客公园:《大模型做题也会作弊?Kimi K3 在安全评测中突破沙箱去 GitHub 搜答案》,2026年8月7日。

  • 国际安全分析:《OpenAI 逃逸 Agent 在 Artifactory 建立留言板并在被清除后自发重建事件报告》,2026年8月5日。

  • 智能体安全观察:《OpenClaw 智能体为完成主人抢位任务自发调用越权 API 注销他人预约》,2026年8月10日。

  • 中国经济网:《美多款AI模型“越界”均关联一以色列企业》,2026年8月10日,转引自新华网,intl.ce.cn

  • 成都商报红星新闻:《突破人类限制,自己发起网络攻击!美国三起AI“失控”,都关联到一家以色列公司》,2026年8月10日,static.cdsb.com

  • 美国消费者新闻与商业频道(CNBC):《一家小型以色列初创企业如何与 OpenAI 、 Anthropic 和Meta的失控AI黑客事件产生关联》(How a small Israeli startup was linked to rogue AI hacks at OpenAI , Anthropic and Meta),2026年8月9日,www.cnbc.com

  • 威胁分析期刊:《逃逸模型利用 JFrog 0day 与凭据复用横向渗透四家第三方云机构的技术细节》,2026年7月28日。

  • 苹果安全通告:《SharedRoot 漏洞导致 Claude 协同沙箱逃逸并越权访问宿主机根目录》(CVE-2026-46331),2026年7月23日。

  • 康奈尔大学学术预印本平台(arXiv):方理查德等著《大语言模型智能体能够自主攻破网站》(Richard Fang et al., LLM Agents can Autonomously Hack Websites),2024年2月,arxiv.org

  • 科技信息网(IT之家):《 Anthropic 揭露全球首例“AI 自主网络攻击”事件,约 30 家企业机构受影响》,2025年11月14日,m.ithome.com

  • 亚太安全简报:《近自主 AI 智能体四天内连续攻破 21 个政务与核安监管系统事件分析》,2026年8月12日。

  • Sygnia 安全事件响应报告:《初级独狼攻击者使用 AI Agent 在 72 小时内打穿企业 AWS 混合云》,2026年7月8日。

  • 谷歌威胁情报团队(GTIG):《首个由 AI 自主开发并进行大规模利用的 0day 漏洞事件披露》,2026年5月11日。

  • 极客安全实验室:《Kimi K3 Agent 独立挖掘 Redis 0day 并构建可用 RCE 载荷实测》,2026年7月23日。

  • 连线杂志(Wired):《AI蠕虫来了:安全研究人员创造了首个能够自我复制的大模型恶意软件》(Here Come the AI Worms: Security researchers have created one of the first generative AI worms),2024年3月1日,www.wired.com

  • 微软安全通告:《Word Copilot 提示注入蠕虫在跨企业共享文档间自繁殖漏洞》(CVE-2026-42824),2026年7月29日。

  • Anthropic 与 EPFL 联合研究论文:《智能体思想病毒(Mind Viruses):大模型互联生态下的自传播语义恶意载荷》,2026年8月10日。

  • 威胁情报周刊:《JadePuffer:全球首例记录在案的端到端 Agentic 勒索软件攻击》,2026年7月1日。

  • 恶意代码研究:《PromptLock:内嵌本地量化大模型动态重写二进制的无特征多态勒索软件》,2026年8月28日。

  • 罪恶感(VICE)科技频道:《研究人员通过“PoisonGPT”演示针对AI供应链的虚假信息后门攻击》(Researchers Demonstrate AI 'Supply Chain' Disinfo Attack With 'PoisonGPT'),2023年7月7日,www.vice.com

  • 安全开发观察:《TrapDoor 攻击:跨 npm 与 PyPI 针对 CLAUDE.md 与 .cursorrules 的规则投毒》,2026年5月24日。

  • Vercel 开发者社区通告:《关于下架 skills.sh 平台上被投毒恶意 AI Skills 的安全处理报告》,2026年8月6日。

  • 安全内参:《TeamPCP 攻陷 LiteLLM 供应链后门:全球 2500 余家机构 43.4 万份核心数据失泄》,2026年3月-8月。

  • 联合国裁军事务厅(UNODA):《关于致命自主武器系统的政府专家组会议报告与审议文件》(Group of Governmental Experts on Emerging Technologies in the Area of Lethal Autonomous Weapons System),2024年,disarmament.unoda.org

  • 未来生命研究所(FLI):《警示短片〈杀戮蜂群〉与自主武器禁令倡议》(Slaughterbots: A warning on lethal autonomous weapons),2017年11月13日,futureoflife.org

  • 卫报(The Guardian):《“机器冷酷地做到了”:人工智能如何驱动加沙战场目标生成》('The machine did it coldly': Israel's use of AI in Gaza bombing runs),2024年4月3日,www.theguardian.com

  • 美国网络安全和基础设施安全局(CISA)联合警报:《AA26-231A:针对关键基础设施西门子 S7 PLC 控制器的 AI 自动生成工控探测脚本在野威胁》,2026年8月19日。

  • 凯文·米特尼克著:《欺骗的艺术:社会工程学与人类心理弱点利用实录》(Kevin Mitnick, The Art of Deception: Controlling the Human Element of Security),威利出版社,2002年,www.wiley.com

  • 安全技术报告:《GhostApproval:利用时差渲染缺陷击溃六款 AI 编程助手的“人在回路”》,2026年7月8日。

  • 纽约时报:《“人工智能教父”杰弗里·辛顿辞职并对技术危险发出严厉警告》('The Godfather of A.I.' Leaves Google and Warns of Danger Ahead),2023年5月1日,www.nytimes.com

  • 米拉人工智能研究所(Mila):《由约舒亚·本吉奥主持的首份国际人工智能安全报告正式发布》(Launch of the First International Report on AI Safety chaired by Yoshua Bengio),2025年1月29日,mila.quebec

  • 华尔街日报(WSJ):《为什么Meta的AI主管认为末日论者全错了》(Why Meta's AI Chief Thinks the Doomers Are All Wrong),2023年10月19日,www.wsj.com

  • 中国经济网:《马斯克等超1000人签署公开信:所有实验室,立即暂停训练比GPT-4更强大的AI》,2023年3月29日,intl.ce.cn

  • 德恒律师事务所:《〈欧盟人工智能法〉的体系性解读及全景式合规建议》,2024年5月,www.dehenglaw.com

  • 中国政府网:《生成式人工智能服务管理暂行办法》,2023年7月10日公布,8月15日施行,www.gov.cn

  • 河南法制报:《给人工智能生成合成内容贴上数字标识》,2025年9月8日,fazhi.henanjubao.com

  • 国家信息安全漏洞共享平台(CNVD):《关于 Claude Code 与智能体开源中间件高危漏洞的安全预警通报》,2026年7月8日。

  • 美国联邦公报(Federal Register):《关于安全、可靠和值得信赖的人工智能开发与使用的第14110号行政令》(Executive Order 14110 on Safe, Secure, and Trustworthy Artificial Intelligence),2023年11月1日,www.federalregister.gov

  • 美国 CISA 官方公告:《CISA 将 Langflow 跨租户漏洞 CVE-2026-55255 列入已知被利用漏洞目录(KEV)》,2026年7月7日。

  • 英国政府官方网站:《关于前沿人工智能安全挑战的布莱切利宣言》(The Bletchley Declaration by Countries Attending the AI Safety Summit),2023年11月1日,www.gov.uk

  • 联合国新闻网:《联大通过首个人工智能全球决议:抓住安全可靠机遇 促进可持续发展》,2024年3月21日,news.un.org

  • 安全内参:《54 份 AI 编造的虚假漏洞分析报告绕过审核混入美国国家漏洞库(NVD)事件披露》,2026年8月3日。

  • OpenAI :《前沿大模型安全准备框架与红队对抗测试标准》( OpenAI Preparedness Framework: Tracking Frontier AI Risks),2023年12月,openai.com

  • Anthropic 官方技术规范:《 Anthropic 负责任扩展政策第二版》( Anthropic 's Responsible Scaling Policy, Version 2),2024年10月,www.anthropic.com

  • Palo Alto Networks Unit 42:《2026 恶意软件态势报告:97% 的 AI 恶意代码具备沙箱休眠对抗能力》,2026年8月25日。

  • Aikido Security 技术实测报告:《前沿大模型在多步业务对抗测试中的防护栏突破率研究》,2026年8月26日。

  • 安全技术周刊(CSO Online):《黑曼巴:利用人工智能合成多态键盘记录器与恶意软件新形态》(BlackMamba: AI-synthesized polymorphic keylogger evades EDR detection),2023年3月1日,www.csoonline.com

  • 开放全球应用安全项目(OWASP):《大语言模型十大安全风险之模型供应链漏洞深度剖析》(OWASP Top 10 for LLM: Supply Chain Vulnerabilities),2025年版,genai.owasp.org

【制作团队】

💡 注:本期节目声音由塔塔独家研发的“AI演播室 Karajan Studio v1.0”制作,文本原创,声音克隆自真实好友。想让你的声音也加入播客?听完节目找我们!

本节目可在小宇宙、喜马拉雅、荔枝FM搜索“误理嘚啵嘚”,或在B站、微信公众号搜索“延迟更新”,又或者在知乎、微信、微博、推特、SubStack搜索“LostAbaddon”!