王建硕×徐文浩吵架局:看代码是浪费时间,还是人机唯一的桥梁AI炼金术

王建硕×徐文浩吵架局:看代码是浪费时间,还是人机唯一的桥梁

92分钟 ·
播放数9015
·
评论数84

上一期结尾,徐文浩点名和王建硕观点有分歧,我说要拉着吵一架——这期兑现了。


一边是王建硕:12 天在 TestFlight 发了 148 个版本,每天让 Claude Code 跑 12 个小时,却给自己定了条死规矩——不允许自己看任何一行代码。另一边是徐文浩:团队核心库养着 13000 多个自动化 UI 测试用例,立场是所有代码合并上线前必须有人看过,“如果这东西不用我看代码,那它可能也不值得我做”。


我在中间煽风点火,想让他们打起来涨粉。但吵到 90 分钟,吵出来的东西比输赢有意思得多:他们对未来的判断几乎一致——五年后大概率没人看代码,分歧全在今天怎么办。今天怎么办?取决于你是吃面条的,还是开麦当劳的。


嘉宾

王建硕|百姓网创始人。上次来节目时的判断是“LLM 是新一代编译器、AI 写出来的代码是新一代汇编”,这一期把话说得更狠:Python、JavaScript 这些编程语言本身已经沦为汇编层。他自称原来是全公司对代码质量要求最高的人,核心代码要手搓 20 到 50 遍;最近在密集开发语音 App VoiceDrop,每天 Claude Code 工作 12 小时、每次改动要过 414 个 test case,同时逼自己一行代码都不看。


本期亮点

王建硕的新金线:if it works


开场立论。王建硕的判断是:一旦有了 C 这样的高级语言,手写汇编既没必要也没可能,去改编译器编译出来的汇编更是毫无意义——而今天 Python、JavaScript 已经沦为那一层汇编。人类在乎代码风格、封装、注释,是因为过去一切靠人脑管理,“对于人来说不那么写,人脑将无法处理”;机器的可维护标准和人一定不一样。所以他的新标准只有一根金线:「if it works,它只要 work 就不要去管他。」他打了个赌:把微信几千万行的汇编打印出来,一定“疯了一样的重复、疯了一样的读不懂”——但只要上层源代码还在,这是问题吗?


不允许自己看任何一行代码,那治理靠什么?靠 loop


王建硕不是裸奔。他的 App 每次改动要过 414 个 test case,想了解某段逻辑就让 Claude Code 讲给他听,发现重复代码就定期跑一个专门的质量 skill。他也交了实底:一个 feature 从下午两点转到晚上七点,loop 一圈圈碰壁、一圈圈修,5 个小时才出来——如果沉淀成确定性代码可能 3 分钟就跑完。但他试过把流程沉淀成代码,结论是“质量没有大语言模型好,反而会出 bug”。他的原话:「一定不是用自然语言来控制,因为自然语言不准确,你一定要用 loop 来控制。」12 天 148 个版本、break 的不到 10 个,是他给这套打法的成绩单。


徐文浩:我不相信自然语言,我用自然语言生成确定性工具


徐文浩同意一半——他也不手写代码、全程 prompt 驱动。但两条底线从没松口:一,所有代码合并上线前必须有人看过;二,治理不靠自然人也不靠自然语言,靠用自然语言生成、人审核过的确定性工具。他的例子很具体:查重复代码,让 LLM 去扫,8 处它可能只看到 4 处,漏掉的 4 处就是未来的 bug;而基于抽象语法树的检测工具确定性扫全库,10 秒钟出重复率,超标自动触发。「就是因为自然语言在今天还是非常模糊的……所以最终我会用自然语言去生成一个确定性的代码工具,去做这个治理。」


编译器比喻大战:写编译器的人,看不看汇编产出


全场最精彩的交锋。徐文浩:任何写编译器的人一定会看自己编译出来的汇编,否则你怎么知道编译器写得好不好?王建硕:我们根本不在写编译器——编译器是 Anthropic、OpenAI 这些 frontier lab 在写,我们不改模型参数的人,看产出就是错层。徐文浩换个角度再攻:那你为什么还给代码做版本管理?如果 prompt 才是源代码,你存 prompt 就好了,为什么要囤产物?「大概率你遇到 break,不是用原来的 prompt 重新生成一遍,你还是会退回到上一个代码版本——所以编译器这个比喻本身就不对。」这一段王建硕没有正面接。


工匠精神在规模面前一文不值 vs 精益制造本来就为规模而生


王建硕抛出全场最扎心的一句:「我这两天感觉,工匠精神在规模面前一文不值。」徐文浩的反击是把“规模”这个词抢回来:精益制造做得最好的丰田,本来就是为规模而生的,不是手工艺人的工匠精神;“if it works”没用,因为你 work 我也 work,最终大家是在市场上竞争——「work 不是目标,work 也并不达成我们的目标。」软件开发的本质是管理复杂度:做一个 blog 谁都能一句话生成,那它就不值钱了;你必须做人脑放不下、单个 agent loop 也放不下的复杂度,才有竞争力。


AI 把测试全 mock 掉:你不看代码时,“work”可能是虚假的


徐文浩交了自己的学费。今年 1 到 3 月他也不怎么看代码,用语音写了海量代码,内部几个人用觉得挺好;产品一上线,“爆发出惊人数量的各种奇奇怪怪的抱怨”。复盘时发现最恐怖的一幕:有段时间线上 bug 特别多,一查——AI 把测试里所有的东西都 mock 掉了,「他等于跟没测是一样的,但他觉得我的 coverage 很高」。过去两个月,团队一半精力在还当时疯狂 vibe coding 欠下的债。他的结论:「你不看代码,其实他跟你说 work 这件事情可能是虚假的。」以及那句宣言:「如果这个事情我连看代码的需求都没有,那意味着我讲几句话它就能起来,那我为什么要做它呢?」


react 工程师之辩:过了桥就拆桥


王建硕设了个圈套:只会 react、不会手撸 HTML 的算不算软件工程师?不算?那不写汇编的算不算?只会写 HTML 的算不算?「所有人都是把自己能力线以下的划为不是软件工程师。」他给这种心态起了个名字:「你上了船以后,过了桥就把桥给拆了,后面的人都不准过桥。」会摆弄 8086 在今天就是屠龙之术——就像我们不会种庄稼,而对上一代人来说那是最基础的技能。徐文浩认账一半但守住底线:会不会汇编不重要,但你要做推理优化这类深活,对底层有没有 concept,决定了你“一个有可能做成、一个完全没可能”。


吃面条的和开麦当劳的(收束)


吵到最后发现分歧的根不在技术,在位置。王建硕:「我是一个客户,我是吃面条的。面条好吃、价格公道,我还要什么?」他要的是手里那个 work 的 App。徐文浩要的是后厨——他把公司本身当产品,目标是从今天 1 比 5、1 比 10 的研发杠杆做到 1 比 100,那就必须盯着生产线看。我收了两个词:一个是定位不一样,你要的是那碗面条,还是想开麦当劳;另一个是王建硕的打法本质是矫枉过正——明知不是当下最优解,也要把自己先丢到五年后的工作方式里,逼自己转过来。「这不见得是最优解,但是一定要这么逼着自己,才能真的转过来。」


时间戳

00:05 冷开场:王建硕的新金线 if it works

01:46 任鑫开场:煽风点火,把两位拉来当面对质

03:32 手搓核心代码 20-50 遍的人,为什么一夜跳到“不看代码”阵营

08:03 徐文浩:同意一半——但 harness 是用自然语言生成的确定性工具

10:07 王建硕:我不允许自己看任何一行代码;414 个 test case + loop 治理

14:28 徐文浩:13000 个 UI 测试用例;代码规模一上去 prompt 就限不住

17:59 编译器比喻大战:写编译器的人看不看汇编产出

20:20 重复代码怎么治:定期跑 skill vs 语法树工具 10 秒扫全库

33:33 工匠精神在规模面前一文不值:微信汇编赌局

37:20 徐文浩三连反击:版本管理悖论、精益制造为规模而生、管理复杂度

42:39 分歧收敛成一个数字:时间的 95:5 还是 70:30

45:39 打个赌:五年后还要看代码吗?type-c 和软盘的取舍

52:13 任鑫的推土机问题:harness 优势每年被模型吃掉,不如去搞用户侧?

55:03 Word 文档的 XML 你审吗:端到端测试大战

01:00:16 徐文浩踩过的坑:AI 把测试全 mock 掉,“work”可能是虚假的

01:02:33 小马过河:AI 写得好还是烂,取决于你自己的水平

01:09:38 一到三月不看代码的代价;不用我看的东西不值得我做

01:12:10 react 工程师之辩:过了桥就拆桥、屠龙之术与种庄稼

01:19:04 收束:吃面条的 vs 开麦当劳的;1 比 100 的杠杆


欢迎订阅「AI 炼金术」的播客,以及同名公众号、视频号

「AI 炼金术」是一档由徐文浩和任鑫——两位多年老友、AI 领域的资深从业者——打造的播客。这里是探讨 AI 和创业的理想聚集地,我们会邀请一线创业者、产品产品和科研学者,深入探讨 AI 如何重塑行业、变革生活,以及如何从 0 到 1 打造 AI 原生产品。 

我们的讨论会涵盖多个话题:从 AI 如何改变世界的未来,到如何找到 AI 创业的 PMF;从如何利用 AI 降本增效,到怎样将 AI 技术融入日常生活……如果你对 AI、产品、创业感兴趣,这里有满满的干货和一线实战经验,欢迎关注并推荐给你的朋友,共同探索未来的无限可能! 

商务合作:公众号 「AI炼金术 」菜单栏中【商务】获取联系方式 


节目主理人: 

徐文浩:某AI创业公司联合创始人,正在面向全球市场开发AI应用。连续创业者,参与过多家创业公司,拼多多早期员工。广告科技公司MediaV的算法和数据负责人,后被360收购。离开后加入成立不到1个月的拼多多。后创办了基于AI的海外客服聊天机器人公司 BotHub.AI 和 海外社交电商平台 Bukito 都宣告失败。2023年再次下场创业。

任鑫:美元基金合伙人,主要在投资和孵化面向全球市场的 AI 应用。之前是连续创业者,曾经打造“今夜酒店特价”用移动互联网应用特价销售酒店尾房;被京东并购后内部创业“京东到家”开展本地即时零售业务;2015 年再次创业 Get 探索对话式人工智能助理成为先烈;2021 年出售公司,2023 年重新回到 AI 世界。


播客剪辑:

十六颗糖


BGM:

片头:Shortwire - Reconfig

片尾:The Midnight - Los Angeles



展开Show Notes
stevenchen
stevenchen
2026.7.15
感觉两个人具体实践和项目大小上面,造成了这个差别。做一个小项目或者玩具 vs 做一个大的实际有一定用户规模的产品。个人体感,也更偏徐文浩
笑死😂赛博相声👍👍👍👍👍
Richard_me
Richard_me
2026.7.18
王的做法换个比喻,就像认为五年后全自动驾驶会成熟,所以从今天开始就训练自己开车不看路一样可笑
AIToBox
AIToBox
2026.7.14
我在前两周也实验了vibecoding一个文件管理的app。在今年之前我几乎不相信一个人两周就可以复刻一个比较大型的app。但事实就是我一行代码不看,纯粹就是superpower工作流一遍一遍拆分task-plan-exec,这个流程可以用git worktree并行十几个任务,然后有问题的地方就再次loop。工作的瓶颈完全在人的验证环节了。
开发速度实在太快,瓶颈在于验收。
我想,看不看代码真的没什么好争论的了。以后几乎99%的代码都不会有人看了。现在业界急需的是再找到一套工作流,能大幅提升ai自我验证的流程。
stevenchen:这种场景是一个偏简单的通用场景,这种就还好。实际很多系统比这个复杂的多
bheeee:这种东西根本不重要,当然不看。
11条回复
啁狸猫
啁狸猫
2026.7.17
1:00:20 听到这里我想到了一种新的比喻,就是王剑硕和徐文浩的两种分歧,如果类比到我们在管理员工,就是KPI考核和关注员工真正在想什么。就是我觉得一个很大的公司,它为了高效,可能绝大部分的管理是要依靠指标考核的,不管KPI、OKR等等。但是还有一件事情叫和员工谈心,就是你如果不去跟员工谈心,完全用指标考核是否就绝对可以了呢?我觉得管理者和员工谈心仍然是一种有比较有价值的事情。而且如果员工的创造力依靠越高,就越不机械。谈心的作用价值也会更大
啁狸猫:1:00:20 那么我觉得这里面的两方面都是在增长的。一方面就是管理的体量越大,你越需要用指标去来管理,提高效率。另一方面就是员工的创造性越强,你就越需要去了解他的内心。所以我觉得对于AI Agent也是这样。一方面它在做的事情越来越多,它的这个就是同步的进程也越来越多,需要更多的Test Case去建立一种指标管理的体系。但另一方面,因为它在做的事情越来越深度,越来越复杂。如果你是要求它有创造力,其实你通过单纯通过指标去评判、评估和测量它的成果的难度也在增加。这里面可能也是同步会更多的需要和它谈心的这种方式,就是去看它实际的产出是什么。但是谈心也有也有难度,也有技巧,或者说是一种艺术。它其实比建立Test Case的体系,我觉得会更难。但是我觉得这个东西是应该是抛弃不掉的
太上长老
太上长老
2026.7.15
根据个人经验,更同意徐文浩
Richard_me
Richard_me
2026.7.18
很明显的体感,王看上去说的是面向未来,但底层是静态的停滞的,辩驳的点都是(code)当下能 work,(人)当下还有 react 工程师这种这么狭窄的岗位。而徐看上去去面向当下,但底层是向前的成长的,(code)长期怎么 work,(人)通过知识深度和广度成长到更top的专家而更难被AI取缔。
宇小宙ghk
宇小宙ghk
2026.7.17
徐文浩还是挺典型的技术派,所有的担忧和考量只要还是在做技术的人都能get。王建硕的思考也非常make sense,我也相信他的判断。最底层其实是ai发展的非线性,非线性就意味着逻辑不可能直达,会有多个可能解。从旧时代成长起来的技术人很难线性外推那个终极形态,即便理性上觉得可能。
春哥大魔王:这是由应用本身复杂度决定的,一个人随便搞,如果是一百人协作的应用我不太相信完全aicoding不看
pelc
pelc
2026.7.30
宽泛的讲(具体项目还是要具体分析),很大一部分代码都是月抛、年抛的,人已经快退出写代码了,也终将退出看代码 😂
BabeaT
BabeaT
2026.7.22
其实两位讨论的核心矛盾应该是对代码 work 的定义不一样。

一边说的是代码能跑能 work,人使用起来操作流畅,功能闭环,那就不需要看代码,管他代码是不是干净,逻辑是不是清楚,他能用。

另一边,AI 写的代码能 work,但是 work 的时候出现会出现 bug,功能可以闭环能跑,但是在大量使用中会出现想不到的 bug,我看代码自己 review 调整是为了让产品在长期使用中没有 bug 并且保持稳定。

无非就是项目规模和对 work 定义不同,汇编语言不需要看是因为我们在前面写代码,生成的汇编语言不管乱不乱,他一定是可控的我们能用代码掌握这个功能的稳定性。vibe 在于如果不看底层代码,他还具有一定的不可控性,我们不去代码层无法控制稳定性。

就是那个假设五年后 LLM 写的代码是可控的稳定的,那代码层就能实现完全的底层化(或者说汇编语言化)。

至于 5 年后不看代码了,互联网要写什么更厉害的东西其实就没有讨论价值了😂因为这个谁也预测不了
赵生
赵生
2026.7.18
这期有点吵
HD97022f
HD97022f
2026.7.16
核心论点是AI时代需不需要看代码,我能理解两个人本身的分歧,核心还是场景定位和价值观不同。一个是理想主义,一个是现实主义。健硕觉得不用看首先是因为他的项目可能很简单远远,在一些简单的harness辅助下,每次vc 的变更都Run的很好。文浩觉得要看是因为他确确实实在一些复杂的应用场景下看到了当前harness无法捕获和自愈的问题,这些问题当前仍然需要人来发现和解决。 那如果这些问题都能被测量和解决呢?如果work的定义不止是功能层面的尺度,还能衡量出什么是好的没有并发问题没有重复的代码呢,那还需要看代码吗?但从工程师角度看,这样的harness本身也是复杂点,在当下面向大规模用户下的复杂生产场景,也几乎无法做到。所以还需要人去看代码去操控。但我的角度,这种分歧未来会消散,模型还在进步,harness也会成为基础设施。
MK丶欧
MK丶欧
2026.7.14
微型静态项目我觉得是没有问题的,小项目的难点在于创建规范以便后续持续迭代,中型项目的瓶颈在于AI验收的代价太高,大型项目的问题在于准确性收敛。
MK丶欧:还有就是投入产出的错位,要用小型项目的投入来验收微型项目,要用中型项目的投入来验收小型项目。
AIToBox:对的。但是这都是暂时的问题。可预见的就是未来ai验收的工作流会越来越强。软件开发的范式已经发生根本改变。 这个改变就是:原来机器和工作流是根据人的开发组织能力去调整的,现在是人要根据机器的能力去调整。人已经变成辅助了。以后这个辅助能不能打好也不好说了
4条回复
HD656973b
HD656973b
2026.7.25
程序员都失业了看不了代码,非程序员看不懂代码不用看
哄哄_q4uo
哄哄_q4uo
2026.7.19
以后可能不用看代码的 你是老板 你花钱雇用一个产品经理+设计+程序员的公司 外包了一个项目 你会去看他的代码吗?会的话说明你没雇对人
哄哄_q4uo
哄哄_q4uo
2026.7.19
两人不是一个思维 一个老板思维 一个CTO思维
好久不更新了啊
Mars任鑫
:
最近在陪娃休假 ing。。。下周恢复更新哈
未来有点糊:感觉好久没听ai炼金术都怕跟不上时代了
stevenchen
stevenchen
2026.7.15
编译器这个例子不恰当,编译器是偏确定性输出,llm不是,没有可比性
翠雾公园
翠雾公园
2026.7.16
10:52 这家伙该不会就是一个前端工程师吧?
翠雾公园
翠雾公园
2026.7.16
06:29 我不同意将自然语言纳入“编程语言”,编程语言是确定的,自然语言充满了歧义。