从LLM到世界模型:AI如何从“会说话”走向“懂世界”
前阵子有个做自动驾驶的老同事问我“大模型这么猛各种榜单一次次刷新为什么到了车上、机器人上还是没人敢把它当‘大脑’来用”这个问题我琢磨了很久答案其实就藏在一个被反复提起、但很少被讲透的概念里世界模型。这几年大家在聊的 LLM、大模型、AI Agent本质上是语言模型的胜利而下一场真正意义上的革命是让模型不再只是“会说话”而是“懂世界”。这篇内容我就从自己的观察和实践出发把“从 LLM 到世界模型”这条线拆开讲清楚为什么 LLM 的天花板已经肉眼可见世界模型到底解决什么问题有哪些技术路径正在被验证以及作为普通从业者我们现在能做什么、该准备什么。文章不堆术语但该硬核的地方不会含糊。不管你是搞算法、做工程、还是刚入门想找方向应该都能从中拿到一些值得参考的判断。1. 先泼盆冷水LLM 的能力红利正在逼近天花板1.1 我们说的“智能炸裂”本质是语言模式的胜利先说个反直觉的事实大模型之所以让人觉得“什么都会”并不是因为它真的在“理解”而是它把人类历史上所有被文字化的知识压缩进了海量参数里然后用一个极其简单粗暴的任务——预测下一个 Token——把这种压缩结果表达出来。你给它一句“今天天气不错我们一起去”它能接出“公园散步 ”你问它“李白是哪个朝代的”它知道是唐朝。这套机制的本质是把世界上所有出现过的话都当成了语料学习的是语言的统计规律和人类在语言里沉淀下来的常识。就像一个读完了全世界图书馆、但从没出过门的人你问什么它都能对答如流但你让它去厨房做一道菜它可能连先开火还是先倒油都不知道。我见过太多人把这个能力误当成“通用智能”。前两年大家热衷测各类模型看到它能写诗、能写代码、能做数学题就恨不得立刻让它去管钱、开车、做手术。但你只要把问题拉到一个需要持续观察、主动干预的场景它立刻就露馅了。这不是说语言模式没用恰恰相反语言模式是大模型革命的第一波红利它让机器第一次具备了“跨领域知识调用”的能力。但我们得清醒这是统计意义上的知识调用不是对物理世界因果关系的掌握。1.2 幻觉、因果缺失与长程规划三个绕不过去的短板如果你平时深度使用 LLM下面这三个毛病你一定不陌生。第一是幻觉。模型会以极其自信的口吻编造不存在的论文、不存在的法条、不存在的 API 参数。原因说起来也简单它学的不是“事实数据库”而是“语言分布”。当某个问题的答案在训练语料里比较稀疏时它就只能靠“猜一个听起来合理的词序列”来补全——这跟人说谎是一样的机制不确定的时候编一个逻辑自洽的故事比承认不知道更容易。第二是因果缺失。LLM 能回答“如果下雨地面会湿”因为它见过太多这种句子。但你问它“如果我把这个杯子往左推 10 厘米它会不会掉下桌子”它没有对应的文字经验可抄只能凭语感糊弄。语言里提到的因果关系和世界真实运行的机械因果是两码事。语言模型甚至很难区分“相关性”和“因果性”——比如“冰淇淋销量高的时候溺水率也高”它可能会一本正经地告诉你两者有某种关联却不会意识到真正的原因只是夏天到了。第三是长程规划失效。让 LLM 写一个 20 步的计划它往往能写出开头几步很合理、后面全靠编的东西。为什么因为它没有“世界状态”的概念。你让它规划周末两天行程它不会在心里维护一个“时间、地点、交通、天气”的实时状态表也不会在每一步之后回头检查“这个计划还成立吗”。它只是在生成一段看起来连贯的文字而不是在执行一个可验证的行动方案。这三个短板恰恰是现实世界任务最核心的要求真实、因果、可执行。这也是我判断“LLM 单独撑不起下一代智能”的根本原因。1.3 一个关键转折从“预测下一个 Token”到“预测世界的下一帧”2024 年初Sora 发布的时候圈内有一个很著名的争论视频生成模型算不算世界模型当时的讨论众说纷纭但有一个共识逐渐清晰——把预测目标从“下一个词”换成“下一帧画面”后模型被迫开始学习一些非常物理的东西。一段猫踩在沙发上的视频如果模型要继续生成下一秒它必须知道猫的四肢怎么受力、沙发垫怎么凹陷、光影怎么变化。哪怕这些知识没有被显式标注为了不让画面崩坏模型也不得不隐式地学到一些近似物理的规律。这就是我说的“关键转折”训练目标变了模型学的东西就会跟着变。语言是人类对世界的抽象描述而视频、图像、传感器数据是世界的原始状态。你让模型预测文本它学的是“人怎么说话”你让模型预测世界下一帧它才可能被迫去学“世界怎么运转”。当然Sora 远不是真正的世界模型它更像一个“视觉上好看但物理上经常翻车”的生成器——物体可能会凭空消失、杯子倒了能自己立回来。但它证明了一件事只要训练目标设计得足够“世界化”模型就能涌现出部分世界知识。沿着这个方向继续走就是通往世界模型的路。2. 世界模型到底是什么大脑里的那套“物理沙盘”2.1 直觉解释从游戏模拟器到“内心世界”“世界模型”这个词最早火起来是因为 2018 年 David Ha 和 Jürgen Schmidhuber 发表了一篇论文就叫《World Models》。那篇论文做了一个很惊艳的演示模型只靠“看”自动驾驶游戏的屏幕画面就能在内心构建一个虚拟环境然后在这个内心环境里反复试错、规划路线最终学会开车。这个思路我可以用一句话概括世界模型是让 AI 在大脑里装一套“物理沙盘”。你想象一下小时候玩打仗游戏几个小孩在地上画个圈说“这是基地”然后就脑补出整个战场敌人从哪边来、子弹往哪飞、谁先倒下。这套脑补的模拟能力就是世界模型的原型——它让我们可以在不真正行动的情况下预演各种可能性。跟传统仿真器的区别在于世界模型不是人类手工编写规则的而是从数据里自己学出来的。传统自动驾驶仿真器你要手动定义每辆车的车速、刹车距离、碰撞规则而世界模型是让模型看过大量真实驾驶数据后自己掌握“车这么开、前面有行人大概率会怎样”的动态规律。所以它在学术上的准确定义大概是**一组对环境的内部表征加上一套状态转移函数——给定当前状态和某个动作能预测下一时刻状态会变成什么样。**有了这套东西智能体就可以在脑子里做预演大幅减少真实世界里的试错成本。2.2 与 LLM 的本质差别目标函数从“似然”变成“因果与一致”很多人以为世界模型就是“更大的多模态模型”这是个误解。它跟 LLM 的本质差别不在于参数数量也不在于输入形式而在于目标函数。LLM 的训练目标是语言似然最大化让模型下一个 Token 的概率分布尽量贴近真实文本。这个目标的隐含代价是模型只需要“说对”不需要“做对”。世界模型的训练目标则是状态预测一致性给定当前状态 s_t 和动作 a_t预测下一个状态 s_{t1}而且这个预测必须在闭环里不断校正。它不只是说一句话而是要保证自己的预测结果在真实世界里持续成立。打个比方LLM 是一个背熟了所有地图的人你问它“从 A 到 B 怎么走”它能流利报出路线世界模型是一个真正走过路的人它脑子里有一张会持续更新的地图——路塌了会绕道下雨了会开慢点它甚至能在头脑里把没走过的岔路先“走”一遍。Yann LeCun 这几年反复强调的 JEPA 架构核心思想也在这里不要预测像素太浪费算力而是抽象出世界的表征在抽象空间里做预测。他主张的“可配置预测世界模型”能处理不确定性也支持多层级规划——这跟 LLM 的“单向逐词生成”是两种完全不同的设计哲学。2.3 为什么多模态不是锦上添花而是世界模型的唯一入口近两年多模态大模型很火能看图说话、能听声音回答。但你要想清楚GPT-4V 那类多模态模型本质上还是“把图像切成 Patch转成 Token送给语言模型处理”。它用视觉信息但仍然是在做语言任务——它的目标还是生成合理的文本回复。世界模型需要的多模态是完全另一种东西。它需要把视觉、触觉、本体感觉、动作指令融合成一个连续的状态表示然后基于这个状态去推演未来。举个例子一个机械臂要抓杯子它需要的不是“描述杯子的句子”而是杯子的位姿、表面摩擦力、抓取瞬间的滑动概率。这些信息只能来自连续传感数据不可能靠文本描述完整传递。还有一点很关键**Token 化对世界来说是有损的。**语言模型把所有东西切成 Token这适合文本但对连续世界是一种天然的不匹配。世界里的空间坐标、时间间隔、力的大小都是连续的硬切成离散 Token 会丢失大量物理细节。所以真正的世界模型大概率需要一套不同于 Transformer 自回归的表征方式——这也是为什么很多团队在搞连续隐空间、动态均衡架构而不是简单地把模型做大。3. 从 LLM 到世界模型的真实路径我看到的三条主线3.1 路线一视频生成倒逼出的世界理解——Sora 现象Sora 带来的最大思想冲击不是“视频有多逼真”而是生成即理解这个范式被验证了。为什么这么说因为要生成一段真实物理过程的视频模型必须隐式地回答无数个“如果……会怎样”的问题如果这个人往前走两步阴影会怎么变化如果球滚到桌边下一秒会不会掉下去这些约束多到无法用规则枚举唯一的出路就是让模型从数据里学到一套近似物理的动态模型。后来很多团队复现了类似思路用海量视频训练扩散 Transformer 来生成连续帧结果发现模型确实涌现出一些基础的物理直觉比如物体遮挡关系、光照方向一致性。但同时也暴露了硬伤它对精确物理规律比如重力加速度、碰撞反弹角掌握得很差经常出现“看起来合理、实际违反物理”的画面。这条路给我的启示是**不要把视频生成当成“做特效”它是世界模型的一种弱形式训练。**即便它现在不完美它也为大模型补充了一类 LLM 永远给不了的东西——对空间和时间一致性的压力测试。顺着这条路未来一定会有“世界模拟器”级别的生成模型出现它生成的每一帧都是对世界状态的合理推演。3.2 路线二具身智能与仿真环境——在“动作-反馈”闭环里学习如果说视频生成是“被动看世界”那具身智能就是“主动改造世界”。机器人、自动驾驶、智能体进了真实环境每走一步都能得到反馈——碰到障碍物会停下来、撞到人会被骂。这种动作-反馈闭环是世界模型最稀缺的训练信号。现在有个很火的词叫“具身智能”。背后的逻辑是语言只能告诉你世界的“描述”而动作交互能告诉你世界的“响应”。你让机械臂抓一万次杯子它学到的不只是“杯子长什么样”还有“怎样的抓取姿态最稳”“抓滑了怎么调整”。这些经验没办法靠读文章获得必须通过与世界的直接互动。仿真环境在这里扮演了关键角色。像 MuJoCo、Isaac Sim、Habitat 这类平台提供了成本极低、可无限重复的交互环境让智能体可以在虚拟世界里跑几百万步。基于模型的强化学习算法最典型的是 Dreamer 系列就是在这种环境里练出来的它在隐空间里学习一个动态模型然后用这个模型在脑子里做“想象 rollout”——预先推演几十步挑一条最优路径执行再根据真实反馈更新模型。这个路线目前离通用还有距离但它是真正意义上“从交互中学习因果”的路子是我最看好的一条长线。3.3 路线三混合大脑——LLM 做推理、世界模型做状态估计上面两条路线都还偏研究但接下来这条是当下最有可能落地的让 LLM 和世界模型分工合作组成一个混合架构。你可以把这种架构类比成人的大脑LLM 负责“大脑皮层”的工作——常识推理、语言表达、抽象规划世界模型负责“小脑 海马体”的工作——实时追踪环境状态、感知物理变化、预测下一秒会发生什么。一个管宏观一个管微观一个管逻辑一个管物理。举个例子。假设你要做一个家庭机器人管家。LLM 可以听懂主人说“把客厅那瓶红酒拿过来”但“那瓶红酒具体在茶几上还是餐边柜上”“走过去会不会碰到猫”“拿了之后桌子会不会洒”这类问题LLM 是不清楚的。这时候就需要一个世界模型实时维护着房间的物理状态图哪里有什么、谁在移动、下一秒可能发生什么。LLM 做高层决策世界模型做低层校验——两者配合一个能“说话”的智能体才真正成为能“干活”的智能体。我为什么说这条路最容易落地因为它不需要等世界模型完全成熟。我们可以先让 LLM 干活同时用一套“状态追踪模块”可以是规则、可以是图数据库、可以是一个轻量神经网络来记录环境状态把 LLM 的输出放进这个状态框架里校验。这其实很多做 AI Agent 的团队已经在悄悄干了——只是他们不一定管那层叫世界模型。3.4 知识基座升级从 RAG 到“世界状态的动态记忆”还有一个被忽视的维度我特别想说一下记忆系统。现在做 LLM 应用几乎绕不开 RAG检索增强生成。它的核心思想是模型参数里没有的知识从外部文档库里检出来塞进上下文里。典型实现是“文档切块 → 向量化 → 相似度检索 → 拼进 Prompt”。RAG 有效但它有个致命局限它检索的是静态文档不是动态状态。文档不会因为你推倒了桌子而自动更新向量数据库也不会记录“杯子现在在桌角”。真正的世界模型需要的是一种持续更新、支持时空查询的动态记忆——知道什么东西在哪、什么时候出现过、和什么有关系、下一步可能变成什么。这让我想到另一个热词GraphRAG 和 LLM Ontology。它们的共同方向是把扁平的知识片段组织成有结构的图——实体是节点关系是边。这个思路跟世界模型的状态表征天然契合世界模型内部存的状态本质上就是一个“带物理属性的动态知识图谱”——房间是节点家具是节点位置关系是边运动状态是节点属性。所以我的判断是未来几年RAG 会逐步进化为RAG 动态状态图谱 在线更新的形态。谁先把“检索”从“找文档”升级成“查世界状态”谁就提前卡位了世界模型的应用层。4. 技术栈拆解世界模型落地需要啃下哪些硬骨头4.1 状态表征如何把连续世界压缩成可计算的表征世界模型第一步就是把高维、连续、嘈杂的传感器原始输入压缩成一个可计算的“状态”。这一步有两个主流方向。一个是用离散隐变量也就是把画面先编码成离散 TokenVQ-VAE、dVAE 这类好处是能直接喂给 Transformer跟你现在训练 LLM 的管线完全兼容坏处是离散化会丢失空间连续性和时序精度。另一个是连续隐变量Dreamer 系列用的就是这个好处是保留了物理世界的连续属性坏处是优化更困难、工程上更折腾。我不建议你上来就站队。更务实的思路是先看任务要什么。如果任务是“看图作文”离散表征够用如果任务是“操控机械臂”连续表征基本是必须的。还有一个趋势值得关注以物体为中心的表示。人类理解世界不是按像素理解的而是按“物体”理解的——杯子是一个物体桌角是一个物体。如果世界模型的状态表征不是“这一个像素块”而是“这一组属于同一个物体的像素 它的属性位置、速度、材质”那么因果推理会容易得多。这类方法在学术界叫 Slot Attention、Object-Centric Learning我个人觉得这是通向“真懂世界”的关键拼图。4.2 想象与规划Latent Space 里预演未来有了状态和动态模型接下来最有价值的能力是在隐空间里做想象规划。为什么这个能力重要因为真实世界的试错成本太高了。自动驾驶在真实道路上撞一次可能就出人命但如果模型能在隐空间里预演一千次“这个路口要不要右转”挑出最安全的那次再执行安全性会大幅提升。这就是“world model planning”的核心优势。具体做法是模型学到了 P(s_{t1} | s_t, a_t) 之后给定当前状态它可以生成多个可能的未来轨迹然后用一个价值函数评估每条轨迹的预期收益选出最优动作。执行一步观察真实反馈再更新状态再重新规划——这就是经典的 model-based planning 闭环。这个思路其实早就被验证过AlphaGo/AlphaZero 的蒙特卡洛树搜索本质就是在“围棋世界模型”规则决定的转移函数里做上亿次想象推演。只不过围棋的世界模型是已知规则而我们要学的是未知的真实世界规则难度天差地别。这里我要强调一个容易误解的点世界模型做想象规划不等于“生成长文本”。LLM 生成文本是单条路径逐词延伸而世界模型的规划是多条轨迹并行搜索。这背后需要的骨架是——树搜索、束搜索、评估函数、不确定性估计这些技能恰好是传统强化学习和经典 AI 的核心跟“会写 Prompt”完全不是一个维度的能力。4.3 评测难题我们拿什么衡量一个模型“懂世界”这是我现在最头疼的问题之一怎么测世界模型LLM 的评测相对成熟MMLU、HELM、Open LLM Leaderboard 那些榜单本质就是“做题”——出一道选择题看模型能不能选对。但“懂世界”没办法用单选题衡量。一个考了满分的学生不代表他真的会开车。世界模型的评测必须放在闭环任务里给它一个起始状态让它在一个虚拟或真实环境里行动看它在多步之后能否达成目标。评价指标不再是“预测准确率”而是“任务成功率”“碰壁次数”“安全违规次数”这类行为指标。像 Physion、CRAFT 之类的物理推理基准已经在尝试用“预测物体是否会掉落”“推断遮挡背后物体形态”这类问题来测试模型的物理直觉这方向是对的但离“真实任务闭环评测”还有距离。还有一层更难的问题**怎么判断模型是因为记住了规则而答对还是真的在内心模拟了物理过程**这有点像拷问学生“你是背出来了还是真的理解了”。目前没有完美答案我的建议是用大量的、分布外的、需要物理推演的新场景来测——凡是训练语料里不可能出现过的场景模型还能不能表现好如果只能记住见过的场景那它再厉害也只是个高级检索器。4.4 部署视角的冷思考压缩、量化与端侧智能聊完学术再聊点实际的世界模型真要落地部署就是绕不过去的坎。LLM 现在能跑起来靠的是量化、剪枝、蒸馏这套工程三板斧。你可以用几 GB 的显存跑一个量化后的 7B/13B 模型也能用 ONNX 导出后塞进边缘设备。很多做“本地部署大模型”的人已经把 llama.cpp、ONNX Runtime、GGUF 这些工具链玩得很熟。这些经验未来在世界模型部署时会全部用得上——甚至会更难。为什么更难因为世界模型往往是多模态的、连续状态的、还要实时推理的。LLM 的推理瓶颈主要在“生成速度”而世界模型的瓶颈在“闭环延迟”从传感器拿到数据到更新状态到产生动作指令必须在几十毫秒内完成。这意味着模型层面的优化之外整个系统的时延设计、状态同步、边缘计算的实时性都得重新设计。我的建议是现在就开始把部署基本功练扎实。量化、蒸馏、剪枝、端侧推理这些技能今天能省你的 GPU 成本明天能决定你能不能把世界模型塞进一台机器人、一辆车、一个摄像头里。别等模型成熟了才开始补工程那时候就晚了。5. 别等革命现在就能做的三件实事5.1 把 LLM 的能力彻底吃透提示词、上下文工程与微调我知道很多读者看到“世界模型”会焦虑是不是得重新学一遍 AI我的回答是不用但你要先把现在这套用透。目前真正为业务创造价值的仍然是 LLM 应用提示词工程、上下文工程、领域微调、RAG 管线。这些技能里含着一个未来不会过时的内核——数据与评测意识。你为 LLM 搭评测集、找 badcase、设计 Prompt、微调数据配比的过程就是训练“如何与智能系统协作”的核心能力世界模型时代照样用得上。实操上我的建议很具体别满足于“调用 API”。要主动做这三件事一是建立自己的评测集至少几百条覆盖你业务难点的样本二是学会上下文工程把系统提示、少量示例、外部知识合理地组织进上下文三是掌握 LoRA 这类轻量微调方法遇到通用模型解决不好的专业场景用几百条高质量数据做个领域适配。这一套下来你对“模型到底怎么才能真正服务于业务”的理解会比 90% 只会喊口号的人扎实。5.2 向世界模型的能力方向补课多模态、时序与空间如果你有精力往下走我建议你现在就开始补“世界模型方向的课”。方向很明确多模态、时序预测、空间推理、强化学习。不需要一上来啃论文。先从基础开始理解图像/视频是怎么被编码的搞懂 Transformer 的 QKV 注意力机制到底在做什么读读“Token 的 key、query、value”相关讲解把注意力理解为一种软性的“检索与整合”然后学时间序列预测理解“过去状态如何影响未来状态”再接触一点强化学习和控制理论知道什么叫“动作”、什么叫“奖励”、什么叫“策略”。一个小建议挑一个你熟悉的领域做一个小项目来感受“预测世界”和“预测文本”的差别。比如用行车记录仪数据做一个“下一帧预测”的 demo或者做一个简单的“追捕游戏”里的世界模型。你很快会发现预测文本时你只需要写得好预测世界时你必须在每一步都满足物理一致性——这个体验式的认知比读十篇综述都有用。5.3 我的个人判断未来 3-5 年真正值得押注的四个方向基于我看到的趋势最后给四个我认为值得押注的方向。第一混合架构的 AI Agent。用 LLM 做推理和语言用世界模型做状态追踪和物理校验。这类系统不需要等技术完全成熟就能开始做属于“现在就能赚未来还能赚”的卡位型方向。第二视频与虚拟环境生成。把世界模型当成“可控制的世界模拟器”用于游戏内容生成、电影预演、自动驾驶仿真数据合成。这个方向商业价值明确一套好的世界模拟器可以替代昂贵的真实数据采集。第三垂直行业的专用世界模型。不用追求通用先在一个受限领域做深仓库机器人的堆叠规划世界模型、试验设备的状态预测世界模型、手术机器人的组织形变世界模型。垂直壁垒一旦建立就是最宽最深的护城河。第四AI for Science 中的连续系统建模。用世界模型的思路去做分子动力学、流体仿真、气象预测这类“有真实物理方程约束”的任务。这类任务里世界模型可以比纯数值模拟快几个数量级而且一旦成功价值不可估量。6. 最后再说两句掏心窝的从我自己的经验看这一波“从 LLM 到世界模型”的叙事跟当年“从 CNN 到大模型”很像一开始大家觉得只是换个名词结果换了之后整个技术栈都跟着变了。我不建议大家只看热闹也不建议大家焦虑追新词。真正要抓的是那个底层变化——模型的训练目标正在从“预测人说的话”转向“预测世界的状态”。抓住这个主线你会看懂很多现象为什么视频生成火了为什么具身智能火了为什么大家都在谈多模态为什么 RAG 在往图谱和动态记忆的方向演化。这些看起来分散的热点其实是同一股浪潮的不同浪尖。如果你想从今天就开始实践我有个特别简单的建议找一个你每天都见到的场景比如你家窗外的十字路口、办公楼的电梯口、厨房的台面用摄像头拍几天数据然后试着做一个“下一帧预测器”。当你发现“预测下一帧”比“预测下一个词”难那么多、但又直观那么多的时候你就真正明白世界模型为什么要单独成为一个研究方向了。剩下的路都是这个起点之后的延伸。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →