[EP58]Zhihao| 从自动科研到世界模型:教育为什么需要更好的反馈?

[EP58]Zhihao| 从自动科研到世界模型:教育为什么需要更好的反馈?

59分钟 ·
播放数137
·
评论数0

大家好,欢迎回到《教育AI智造者》。

当 AI 可以在几秒内给出一份调研、一个研究路径、一段代码,甚至一个看起来完整的解释时,“得到答案”正在变得前所未有地容易。但这也让另一个问题变得更尖锐:我们究竟是在搜索已经存在的知识,还是在做研究?AI 替我们把事情完成,和我们真正理解其中的判断与证据,之间又差了什么?

这一期,我们邀请到Zhihao。他目前在香港中文大学攻读 AI 方向博士,关注具身智能中的 self-evolving agent(自我进化智能体)与 world model(世界模型),也做过自动化科研相关的开源实践。对他来说,研究不是某一类人专属的神秘活动,而是一个持续提出假设、寻找证据、验证并消除不确定性的过程;产品、工程和教育,也都可能有同样的结构。

对谈从Auto Research讲起:让智能体自动科研,真正困难的不只是让它“会做事”,而是定义一个可信的评估器。模型能力不足,或评估信号偏离目标,都会让自我优化朝错误方向加速。于是,研究品味(research taste)不再只是抽象的审美:它落在什么问题值得做、什么指标算进步、哪些反馈必须由人介入。

我们也把这个问题带到教育。数学和编程相对容易验证,教育中的学习、兴趣、情绪与认知变化却很难被简单的点击量、观看时长或一次考试完全捕捉。面对难以操作化的反馈信号,技术可以提供新的观察和模拟工具,但教师的判断、学习者的自我觉察,以及对“什么才算学会”的持续追问,仍然不能被一个漂亮的指标替代。

后半段,我们聊到世界模型:它不只是生成逼真视频,也不等于模型能用文字描述“杯子掉到地上会碎”。在本期采用的理解里,一个更完整的世界模型需要能推演状态变化、将状态渲染为可观察的画面,并根据目标输出行动。它之所以令人兴奋,是因为仿真环境或许能让机器人和智能体以更低成本反复试错;它之所以仍然困难,是因为物理世界的数据远比数字世界稀缺,真实世界的状态也远比表面画面复杂。

这期节目表面上讨论的是自动科研与世界模型,更深处讨论的其实是:

当 AI 的杠杆越来越长,我们如何不只是把判断外包出去,而是借它更清楚地认识问题、认识证据,也认识自己?

内容大纲

- 为什么Zhihao会从自己的科研需求出发,做自动化科研相关的开源项目?

- 搜索(search)和研究(research)的边界在哪里?“互联网上已经有答案”和“需要产生新知识”有什么区别?

- 对陌生问题先问 AI:这是效率提升,还是探索模型能力边界的一种方法?

- AI 已经替你总结论文之后,怎样避免“我以为我懂了”?

- 如何用自己的知识框架、Notion 或 Obsidian,让 AI 的信息进入而不是取代你的理解?

- 为什么复述、重讲和费曼学习法,仍然是检验理解的必要动作?

- Auto Research 自动化的到底是什么?评估器、搜索策略与人类介入分别承担什么角色?

- 基础模型能力与评估器质量,为什么是自我进化智能体的两条边界条件?

- “研究品味”如何具体地体现在定义问题、设定指标和判断方向上?

- 教育中的总结性评估与形成性评估,怎样对应不同类型的反馈信号?

- 点击、停留时长和完成率,为什么不能直接等同于学习真的发生了?

- 当教育中的兴趣、情绪和认知过程难以观测时,传感器与脑机接口可能提供什么,又不能替代什么?

- 为什么具身智能和机器人比数字世界里的 AI 更难做?物理数据为什么稀缺?

- 在本期的定义中,世界模型为什么需要状态预测、渲染与策略(policy)三种能力?

- 语言模型、视觉生成模型与世界模型:它们分别能描述、渲染或推演什么?

- 世界模型如果足够成熟,能否降低科学试错和探索式教育的门槛?

- 给普通听众的三个行动入口:尽快用 AI、搭建自己的知识体系、进入真实的 AI 社群与协作环境。

本期最重要的关键词:评估器(Evaluator)。它不只是给结果打分的工具,而是在决定一个智能体、一个研究流程,甚至一个学习系统会朝什么方向优化。


-----------------------关于伊伊子----------------------

伊伊子的小红书传送门

伊伊子个人网站

EduAI Builders 网站

EduAI Builders GitHub

----------------------关于听友群-----------------------

如果您对 AI 和教育的融合充满兴趣,欢迎填写我们的听友群入群申请问卷!🎧 点击链接或扫码,与更多志同道合的伙伴交流行业动态、分享实践经验,并共同讨论人工智能将如何改变教育。期待在听友群中与您相遇,共同成长!😊

请大家填写微信联系方式时,务必确认拼写完整、正确。我们遇到过几次微信 ID 无法识别的情况,谢谢大家!

============关键词解析============

Research|研究

本期中,研究不是单纯找到现成答案,而是围绕一个尚未被充分解决的问题提出假设、设计验证,并逐步减少不确定性。搜索可以是研究的一环,但当答案只存在于已有资料中时,它本身还不等同于研究。

Search|搜索

搜索是在已有信息、文献和经验中定位答案或线索。在 AI 时代,它可以极大缩短进入陌生领域的时间;但它提供的是已有知识的入口,不能自动保证问题本身新颖,也不能替代验证。

Auto Research|自动化科研

让智能体参与资料搜集、提出方案、写代码、运行实验、读取反馈并迭代的工作流。本期的重点是:它能否成立,取决于模型能力、反馈质量以及研究者是否定义了真正值得优化的问题。

Self-Evolving Agent|自我进化智能体

指能够在反馈回路中改进自身行为或能力的智能体。它不仅用 AI 做研究,也可能让智能体依据生成的轨迹与评估信号,在特定领域中进一步优化自身。

Evaluator|评估器

评估器把“做得更好”转成可用的反馈信号。编程和数学往往有相对清晰的测试或答案;在开放研究、教育和现实任务中,评估器更难定义,也因此更需要人的判断与研究品味。

Human in the Loop|人在回路中

人在关键节点审查方向、修正不合适的方案、解释例外的参与方式。它不意味着人要手工完成全部工作,而是把人的注意力保留给目标、边界、价值与不可轻率自动化的判断。

Research Taste|研究品味

本期里,它是一种综合能力:能提出重要而有趣的问题,形成有价值的假设,设计验证,并在反馈中快速迭代。它可以经由研究训练增强,而不是少数人的天赋标签。

Formative Assessment|形成性评估

发生在学习过程中的反馈,例如学习任务、解释、修改与阶段性产出。它的目的不是只在最后判定对错,而是帮助学习者和教师理解下一步应如何调整;简单行为数据可以提供线索,却不能自动等同于理解。

Summative Assessment|总结性评估

通常在一个阶段结束时判断成果,例如考试分数或最终作品。它便于得到相对清楚的结果信号,但若只依赖它,往往无法看见学习在过程中的困难、兴趣和变化。

Embodied AI|具身智能

让 AI 在机器人或其他物理载体中感知、行动和学习的方向。它面对真实世界中的摩擦、对象变化、失败恢复和数据收集,因此不能简单照搬数字世界的数据规模和训练方式。

World Model|世界模型

本期借用的理解是:系统能根据当前状态与动作预测下一状态,将状态渲染为人可理解的观察,并根据目标输出行动。这个定义比“生成一个逼真画面”更严格;它仍是快速发展、尚有许多技术边界的方向。

State|世界状态

指系统中与任务相关的真实条件,而不仅是文字描述或一张图像。例如物体的位置、速度、接触关系和任务是否成功,都可能属于状态。能否可靠地从有限观察中推断状态,是世界模型的核心困难之一。

Policy|策略

在一个目标和当前状态下,决定下一步采取什么动作的规则或模型。世界模型若只能展示或预测,而不能帮助选择行动,仍不能完整承担具身任务中的决策角色。

Simulation|仿真

在可控环境中模拟世界变化,以较低成本重复实验、恢复初始状态并比较方案。它可以扩展试错的规模,但仿真与真实世界之间的差异,仍需要谨慎验证。

Synthetic User|仿真用户

用 AI 生成或模拟的用户,用于探索产品可能的交互路径。本期中的例子是模拟学生使用学习网站;它可协助测试假设,却不能直接证明真实学生已经发生了同样的认知与情感变化。