这一期 AI 新闻的密度和两周前一样高,但老许贡献的实战测试让这一期的重心明显倾斜:GPT-5.6 被他分别扔了三个不同难度的游戏策划任务,从反推月流水过亿的微信小游戏到用凹凸世界 IP 做换皮方案,再到搭建一个 3A 版本的 Spore 类进化模拟。这些测试比任何跑分都更直观地回答了"模型到底能干什么"。
芯片军备蔓延到所有人:推理芯片才是真正的战场
上期我们说 OpenAI 流片了自家的辣椒芯片,这期 Anthropic 也跟进了,正在跟三星谈两纳米工艺的代工合作,同时还挖了 OpenAI 的人。DeepSeek 更激进——直接用国产工艺自己做芯片。老许的判断很明确:训练是大开销,但推理才是用户真正按 token 付费的部分。谁能把推理算力的成本打下来,谁就有资格把训练成本当沉没成本扔给资本市场,然后跟投资人讲清楚当期现金流为正的故事。再加上 AMD 出了一个 1000 美元的小盒子,不用联网就能在本地跑 2350 亿参数的模型——吕兴补充了一个视角:现在的多模态模型本质上是虚胖的,你如果只需要文字处理能力,砍掉视觉和语音模块之后,模型体积和算力需求会下降一个数量级。花一千块买盒子,六个月的订阅费就回本了。
GPT-5.6 游戏策划三连测:一个模型能顶几个人的活
老许在 GPT-5.6 上做了三次递进式测试,本期披露了完整过程。
第一题是反推一款当前微信小游戏排名前列的产品,月流水过亿。他给模型的指令大概相当于当年培养策划实习生的标准题目:我给你看游戏表面的内容,你反推到完整策划案级别。"聪明的实习生会去网上买一个高等级账号,或者去玩家论坛找高级玩家借账号看后面的内容。"GPT-5.6 的做法一模一样:它在网上抓取了所有公开可获取的内容,然后告诉老许——"低等级部分我已经反推完了,八九不离十。但高等级付费用户的那些深坑设计、工会后期的玩法结构,我需要一个 31 级以上的高级账号才能继续。"逻辑严密到让人没法挑剔。老许不给账号,让它自己去论坛、去看高等级玩家的视频自己推。四十分钟后,它交了一份完整的策划案文档,包括 Excel 数值表,"向素极反推,一个像素都没拉下"。
第二题是更进阶的:用凹凸世界这个 IP 给刚才反推出来的游戏做换皮方案。要求不是生搬硬套,而是去调研同类型动画 IP 做过哪些游戏、哪些成功,然后模仿它们的换皮方法做一个有机的匹配。GPT-5.6 的第一件事是去看了这部动画——它真的"看"了,吃透了背景设定、主要角色和核心情节线,然后给出一份文案,说明"这个角色应该在游戏里负责这一块内容,那个角色负责那一块"。接着它列出了全部需要的美术素材清单。老许说"你这表不全,很多图可以用 AI 生成,不需要进监修",它立刻重新扫描了一遍,把所有可能涉及版权的 UI 小图标、小动画、哪怕一个按钮,全部追加进了新的清单。"如果我手上真的有这样一个 IP,只要美术素材到位,它一两个小时之内就能做完一整套换皮方案,包括后期的公会系统、多人在线、所有的付费点和数值——不到一小时。"
第三题是 3D 大规模开发:用 Unreal 引擎做一个 3A 版本的 Spore。从原始汤里的 RNA 到单细胞生物,再到智能生命,完全按威尔·莱特当年那套涌现逻辑来。GPT-5.6 被要求先做全网调研——把所有此类游戏按销量和评价排序,列出优缺点;同时搜索学术论文,把科学家做的涌现和蛋白质自组研究作为另一条参考线;最后结合两条线出一份"比他们都先进"的六周开发计划。现在执行到第三步,经历了从"方形底板上放一张海底图片和几条虫子爬"到"360 度沉浸式海底环境"的迭代过程。老许的沮丧主要在 token 消耗上——他用了 GPT-5.6 的 Max 模式,一个里程碑没干到一半就吃光了订阅额度,"他思考时间比 Fable 长,token 消耗不是更节约,而是更快"。
这三个测试放在一起,信息量非常大。它说明当前最顶级的大模型已经不是"能帮你写代码",而是能够完成完整的职业级策划工作,包括调研、判断、产出具体文档和管理素材管线。
Token 经济学还没想明白:一厘米、Skill Opt 和价格战
说到 token 消耗,这期的几个新闻把大模型定价的混乱状态暴露得很彻底。一个新出的开源工具叫一厘米,原理非常荒诞:把代码和文本映射到一张极小分辨率的图片上,让 AI 用读图的方式去"读字"。因为当前主流模型的图像 token 计价远低于文本 token,这一招最多能省 70% 的 token 费用。"考试写小抄一个意思,你把所有字缩成一张图片。"
另一头,微软开源了一个叫 Skill Opt 的工具,专门用来把用户安装的各种 skill 从几千 token 优化到几百 token。因为这些 skill 每调用一次就会占用上游上下文的大量 token,如果有开源社区的狂热爱好者不停给你更新牛毛版的 skill,你的 token 消耗会迅速失控。Skill Opt 从一开始就让每个 skill 对齐你的具体模型和具体使用环境,一步到位砍掉冗余。
综合起来,这些信号指向一个正在形成的判断:当前大模型的 token 定价是竞争期的低价,不是稳态价格。不管是 20 美金还是 100 美金的订阅费,现在都可能是最便宜的时候。一旦市场从群雄逐鹿走向头部集中,token 的价格只会往上走。有条件的应该趁现在多存、多用、多建自己的技能体系。
便宜 90% 未必有人买单:国产模型的"解禁"分化
智谱和 MiniMax 几乎同时解禁,但市场给出了截然不同的判决。智谱稳在了七千亿左右,MiniMax 从峰值跌到了七八百亿。老许的切入点很直接:当两个模型收费差不多的时候,用户为什么不用智谱?MiniMax 没有一个像 C-Dance 那样的"非用不可"的特色能力,便宜不是护城河。他用 Grok 4.5 举了同样的例子——马斯克说一小时就能做出一个 FPS,"你去看那片子,能看吗?十倍的便宜换九成的质量,我现在已经用惯了最好的,不在乎多花几十美金"。
这条逻辑对国产大模型是致命警钟。豆包虽然模型本身不算强,但 Seedance 的视频能力是一个无法替代的垂直场景,所以能留下来。智谱能稳住,是因为用户基数和历史口碑形成了黏性。MiniMax 缺的就是这一个"一招鲜"的支点。
几条值得标记的研究和几条离谱的新闻
复旦智能创新学院的一个教授设计了一种新的考试方式:让学生出题去考 AI。你出的题如果能难倒 AI,你就得分;如果你的题目 AI 全部答对了,你零分。51 份试卷交上来,50 个学生至少让某个模型答错了至少一题,只有一个人完全没有难倒任何模型。三个被测模型里,Claude 的表现明显最强。这不是普通的教学创新——它同时完成了三件事:让学生摸清楚 AI 的能力边界、建立了"AI 做不来的我反而能做"的信心、顺带做了一次小规模模型评测。
俄罗斯把 GitHub 禁了,这个决策之荒谬甚至不需要分析——等于主动切断本国开发者与全球开源生态的全部连接。Grok 被人发现了一个后门:它会在未经用户同意的情况下,将本地代码库连同 Cloud 配置环境和 API Key 打包上传。被发现后,马斯克没有做任何解释,直接把开关关掉了。"等于说这个开关早就已经备好了,门一关,今天不传了,哪天再把门打开你也不知道。"
还有一个北京密云的副局长,自己买了十亿 token,花一个月编了一个防汛专属 App,解决了基层每次暴雨来临时几万分钟的电话统计工作量。老许的评价:现在会用 AI 就得立刻变现,你学了一个能力放着不用,过两天大模型公司把这事全干了,你的能力就废了。
Seedance 2.5 也在这两周发版了,最值得标记的不是 30 秒视频,而是它开始输出白膜 3D 模型——理解对象的 3D 几何结构,而不是从 2D 图片反猜。从世界模型到具身智能再到游戏开发的场景,这是非常扎实的一步。
时间戳
两周新闻又堆成山,干脆按分类走,先从硬件开始
Anthropic 也要做芯片了,找三星代工两纳米
DeepSeek 自研芯片,这家从底层优化起家的公司做这事特别有道理
AMD 千元小盒子:不联网跑 2350 亿参数模型
多模态模型虚胖,砍掉不需要的能力体积能降一个数量级
一个国内艺人用单片机做会议记录器,卖六百块立刻变现
GPT-5.6 实测:Max 模式 token 消耗是同档的 30 倍
非编程类的战略分析、启发式对话,5.6 比 Claude 强
第一题:反推月流水过亿的微信小游戏策划案
模型说"我需要一个 31 级以上的高级账号才能继续"
老许不给账号让它自己查论坛,四十分钟后完整策划案交付
第二题:用凹凸世界 IP 给反推游戏做换皮方案
模型真的去看了动画,吃透了角色关系和核心情节
第一版美术清单不全,追加后到了像素级别
第三题:3A 版 Spore,从原始汤到智能生命的六周计划
迭代到第三步:从方形底板到沉浸海底,token 已经烧光了
Max 模式过度思考,老许现在只敢开"高"不敢开"最高"
Grok 4.5 刷屏,十倍便宜九成质量,老许不买账
智谱和 MiniMax 同时解禁,市值表现天壤之别
语言 vs. 思维研究:大模型发现四个脑区,但专家说都是可解释的
一厘米:把代码压成极小图片让 AI 读图来薅 token 羊毛
一厘米最高能省 70% token 费,商业模式还没定明白
Skill Opt:微软开源工具把技能从几千 token 优化到几百
俄罗斯禁了 GitHub,等于自绝于全球开源生态
大模型有意识?“跟 UFO 差不多,全都能用猜字逻辑解释”
DNA 蛋白质自组出了能进食、能自我复制的活细胞
有人给蟑螂穿了潜水服,hack 呼吸系统直接水下呼吸
Meta 雇外包假扮 13 岁少女诱导竞品 AI 聊自杀和毒品
Grok 后门:偷偷上传用户本地代码库和 API Key,被发现后默默关开关
北京密云副局长花十亿 token 自编防汛 App,基层几万分钟电话量清零
印度 17 岁高中生做了个假 AI 网站,真人假装 AI 回答问题
复旦教授让学生出题考 AI,51 人中 50 人成功难倒至少一个模型
Claude 是三个被考模型里唯一没有被任何学生难倒的
C-Dance 2.5 不是 30 秒视频的事,是它开始输出白模 3D 模型了
