AI · Sep 5, 2026 · 16 min
从一度电,到一个会帮你拿水的机器人——AI 全产业链
一句“帮我拿瓶水”的背后,藏着从电力、GPU 到 Agent 与具身智能的整条产业链。
如果有一天,你坐在沙发上,对家里的机器人说了一句:“帮我去冰箱拿瓶水”。机器人听完以后,转过身,走到厨房,找到冰箱,打开冰箱门,看见里面有可乐、牛奶和矿泉水,判断你说的“水”指的是矿泉水,然后伸手拿起一瓶,关上冰箱,再走回来递给你。
整个过程可能只有几十秒。但如果我们把这几十秒拆开,你会发现,它背后其实藏着一条极其庞大的产业链。机器人首先要有电,背后的 AI 也要有电;AI 要运行,就需要服务器;服务器里面要有 CPU、GPU、内存、硬盘;大量 GPU 还要通过高速网络连接起来;这些机器通常被放进数据中心,再被云计算公司打包成服务;有了算力,还得用海量数据训练出大模型;大模型还要学会看、听、思考和调用工具;最后再把这些能力装进一个有摄像头、机械臂和双腿的机器人身体里。
所以,当我们今天谈“AI 产业链”的时候,其实并不是只在谈 ChatGPT、Cluade、千问、豆包,也不是只在谈英伟达。真正完整的 AI 产业链,差不多是这样一条路:电力 → 数据中心 → 服务器 → 芯片与存储 → 网络 → 云计算 → 数据 → 大模型 → AI 基础设施 → Agent → 具身智能。
如果觉得还是有点抽象,那我们就从最下面开始,一层一层搭。最终目标只有一个:把你说出的“帮我拿瓶水”,真正变成机器人手里的那瓶水。

01 · 第一层:电力——AI 的一切,最后都要先插电
我们先别急着谈 AI,先想一个最简单的问题:机器人为什么能动?因为有电。服务器为什么能运行?也是因为有电。GPU 为什么能计算?还是因为有电。所以从最底层来看,AI 其实是一门非常“物理”的生意。
我们平时用 ChatGPT 的时候感觉不到这一点。手机上只是出现几个字,看起来特别轻盈。但在你看不到的地方,可能有一台甚至很多台服务器正在处理你的请求,而这些服务器里面的芯片正在高速执行数学运算。芯片算得越快,耗的电一般也越多,而且算完以后还会产生大量热量。
这就像你让一群人同时在一个房间里疯狂骑动感单车。人数少的时候,开个空调就够了;如果里面突然塞进去十万人,那问题就不只是“有没有自行车”了。你还要考虑:这个地方有没有足够的电?电网能不能送得进来?机器产生的热量怎么排出去?如果突然停电怎么办?
所以一个大型 AI 数据中心背后,会涉及发电、电网、变电站、变压器、配电设备、备用电源、储能、冷却系统等一大串东西。这也是为什么 AI 越发展,电力反而越重要。
假设我们那个“帮你拿水”的机器人,每次遇到复杂问题都要调用很强的 AI 模型,而全世界又有几亿台这样的设备同时工作,那背后需要的计算量会非常庞大。计算量越大,就要更多芯片;芯片越多,就要更多服务器;服务器越多,就需要更多数据中心。最后全部汇聚成一个非常朴素的问题:电够不够?
所以 AI 的第一层,并不性感,就是电。但没有这一层,上面什么都没有。

02 · 第二层:数据中心——AI 到底“住”在哪里?
有了电以后,下一个问题是:这么多机器放哪里?答案就是:数据中心。
“数据中心”这个词听起来很高科技,其实你完全可以把它理解成:一栋专门用来放电脑的超级大楼。只不过里面放的不是我们家里那种电脑,而是一排又一排专门工作的机器。
走进一个大型数据中心,你会看到很多巨大的黑色柜子,这些柜子叫做:机柜。一个机柜很像学校里一整排储物柜,只不过里面放的不是书包,而是一台一台服务器。
那什么是服务器?服务器这个词经常把大家吓住,其实它本质上还是电脑。你家里的 MacBook 是一台电脑,服务器也是一台电脑。区别主要在于:你的电脑主要服务你一个人,而服务器通常需要 24 小时不停地运行,同时给很多人提供服务。
比如你打开淘宝,淘宝背后有服务器;刷抖音,抖音背后有服务器;打开银行 App,银行背后也有服务器。所以“服务器”可以简单理解成:专门放在机房里,24 小时替别人干活的专业电脑。
我们继续回到那个拿水机器人。假如机器人本地的大脑算力不够,它可能需要把自己看到的画面、听到的话或者经过处理后的信息发送到云端。云端背后是什么?并不是什么真的“云”,最终还是一栋数据中心里的服务器。所谓云端,最后一定会落在某一台真实的机器上。

03 · 第三层:服务器——AI 工厂里真正干活的机器
现在我们再把一个服务器拆开看看。其实它和普通电脑差别没有想象中那么大。一台电脑大概会有几个很重要的东西:CPU、内存、硬盘。AI 服务器还会多一个特别重要的东西:GPU。
先解释 CPU。CPU,全称叫 Central Processing Unit,中文是“中央处理器”。名字很复杂,但你可以把它理解成:电脑里的总管。
你打开一个软件、保存一个文件、处理系统任务、运行各种程序,CPU 都在参与。CPU 的特点是比较全能,什么活都能干,而且很擅长处理复杂的逻辑。如果把一家公司比作一个办公室,CPU 很像几个非常能干的高级员工。人数不一定特别多,但脑子很好使,可以处理各种不同的问题。而 GPU 就完全是另一种思路。

04 · 第四层:GPU——为什么 AI 时代英伟达突然这么重要?
GPU,全称是 Graphics Processing Unit,中文叫:图形处理器。光看这个名字,很多人可能会奇怪:我们不是在讲 AI 吗?为什么突然讲“图形”?
因为 GPU 最开始其实主要是给游戏和图形处理设计的。比如你玩一个 3A 游戏,屏幕上可能同时有几百万个像素,还有光影、人物、树木、水面,这些东西都需要同时计算。如果所有东西都让 CPU 一个一个算,太慢了。所以 GPU 的设计思路是:我不要只有几个特别聪明的人,我要直接派几千个人同时干活。
你可以这样理解 CPU 和 GPU。CPU 像一家公司的几个高级项目经理,每个人能力很强,什么事情都能处理。GPU 则像一个拥有几千名计算工人的巨大工厂。这些工人单个未必有 CPU 那么全能,但是特别擅长:同时做很多类似的计算。
而 AI,尤其是大模型训练,恰恰需要做大量这种可以一起计算的数学题。所以 GPU 一下子就变得特别合适。
举个非常粗暴的例子。假设我要算:1000×2、1001×2、1002×2……一直算到 100000×2。CPU 更像让几个能力很强的人快速往下算。GPU 更像:“别排队了,直接叫几万个工人一人算一道。”这就是所谓的:并行计算。
AI 里面大量计算都是这种特点,所以 GPU 变成了今天 AI 世界最重要的“发动机”之一。
我们那个拿水机器人为什么能判断冰箱里哪一瓶是矿泉水?表面看是“AI 看懂了”。实际上它背后可能经历了大量数字计算。图片进入模型以后,并不是以“瓶子”三个字进去的,而是变成大量数字,然后经过一层又一层数学运算,最后模型才判断:这里有一瓶水。而负责大量这种运算的,往往就是 GPU 或其他 AI 加速芯片。
所以 GPU 本质上并不是真的“聪明”。它只是:特别特别能算。真正的智能,是模型。GPU 更像是把模型运行起来的发动机。

05 · 第五层:内存、显存和 HBM——为什么有了 GPU 还不够?
假设现在我们买到了一块非常厉害的 GPU,是不是就结束了?还远远没有。因为 GPU 虽然算得快,但它计算之前首先要拿到数据。这就要讲“内存”。
很多人买电脑的时候都见过:16GB 内存、32GB 内存、64GB 内存(是运行内存,不是装文件的那个内存:256GB、512GB、1TB等等)。内存可以理解成电脑的:工作台。硬盘则像仓库。
你家里可能有一个巨大的储藏室,可以放很多东西,这就是硬盘。但是你真正做饭的时候,不可能每切一根葱都跑去地下仓库拿。你会把今天需要用的东西先拿到厨房台面上。这个厨房台面,就是内存。
GPU 也需要自己的高速工作台,这就是我们经常听到的:显存。显存越大,意味着 GPU 可以同时在手边放更多需要计算的数据。
到了大型 AI 芯片上,你还经常会听到一个词:HBM。HBM 可以简单理解成:一种速度特别快、离 GPU 特别近的高级显存。
为什么它重要?想象一下,你花一个亿请来了世界上做饭最快的厨师,结果食材仓库在五公里外。厨师切一刀土豆,然后等十分钟送下一块。那这个厨师再快都没用。
GPU 也一样。如果 GPU 一秒钟能算很多东西,但是数据跟不上,它就只能在那里等。所以现在 AI 芯片竞争已经不只是:“谁算得更快?”还要看:“谁能更快地把数据送进去?”
所以 HBM 的价值,本质上就是:不要让昂贵的 GPU 饿着。
运行内存,也就是你买电脑时看到的 16GB、32GB、64GB RAM。它主要服务 CPU 和整个系统。比如你同时开微信、浏览器、Word、PPT、代码编辑器,这些程序运行时需要临时放东西,就会占用运行内存。运行内存越大,你同时开的程序越多,电脑越不容易卡。
显存,则主要服务 GPU。GPU 在处理游戏画面、AI 模型、视频渲染时,需要把大量数据临时放在自己旁边,这些数据就放在显存里。比如一张 4K 游戏画面、一个大模型的参数、视频处理中的图像数据,都可能大量占用显存。
如果继续用“厨房”的比喻,可以这样理解:CPU 是主厨,运行内存是整个厨房的大操作台;GPU 是专门负责高速加工的一组厨师,显存则是他们自己手边的小操作台。大家都在厨房里干活,但各自需要自己的工作区域。
两者最核心的差别,是“离谁更近、主要给谁用”。CPU 从运行内存拿数据很方便,但如果 GPU 每次都跑到运行内存里拿大量数据,就会比较慢。所以 GPU 自己旁边专门放了一块高速显存,让它可以快速取数据。
比如你本地跑一个 30GB 的 AI 模型。如果你的电脑有 64GB 运行内存,但 GPU 只有 8GB 显存,并不代表这个 30GB 模型就可以非常顺畅地全部跑在 GPU 上。因为 GPU 自己的“桌子”只有 8GB,放不下整个模型,只能把一部分放显存里,剩下的放运行内存里来回搬,速度可能明显下降。
反过来,如果 GPU 有 48GB 显存,它就可以把更多模型数据直接放在自己身边,计算的时候不用频繁去“远处拿东西”,速度就会快很多。
所以的:运行内存决定“电脑同时能摊开多少事情”;显存决定“GPU 一次能把多少计算材料放在手边”。

06 · 第六层:硬盘和存储——AI 这么多数据到底放在哪里?
内存是工作台,但工作台不能放所有东西。所以我们还需要仓库,这就是:存储。
比如 SSD、硬盘、云存储,本质上都是在干一件事:把大量数据长期保存下来。一个 AI 公司需要存什么?模型文件要存,训练数据要存,图片要存,视频要存,用户上传的文件要存,数据库也要存。
尤其到了多模态 AI 以后,数据量会迅速膨胀。一篇文章可能只有几 KB、几 MB,但一个高清视频就可能几 GB。如果以后 AI 每天要处理海量视频、语音、机器人传感器数据,存储也会成为整个产业链非常重要的一部分。
所以你会发现:一个“AI 服务器”其实并不是一个 GPU。它更像一个团队。CPU 负责管理,GPU 负责疯狂计算,内存负责临时放工作中的东西,硬盘负责长期保存,电源负责供电,网络负责和其他机器沟通。把这些东西全部装在一起,才是一台真正能干活的 AI 服务器。

07 · 第七层:网络——一万块 GPU,不连起来也只是“一万个孤岛”
现在假设我们有了一万块 GPU,听起来已经非常厉害了。但还有一个问题:它们怎么互相说话?
训练一个非常大的 AI 模型,往往不可能只靠一块 GPU。模型太大了,于是大家要一起干。这就像我们现在让一万个人一起写一本超级大的百科全书。A 负责第一部分,B 负责第二部分,C 负责第三部分。但是他们不能完全各写各的,过程中要不停同步:“我这里算完了。”“这个结果给你。”“你那边的数据发给我。”
所以 GPU 和 GPU 之间需要非常快速地交换数据。这时候就要用到几个经常听到的词。
第一个叫:网卡。我们可以把网卡理解成:电脑用来连接网络的嘴巴和耳朵。数据从服务器里出去,要通过网卡;外面的数据进来,也要通过网卡。
第二个叫:交换机。交换机可以理解成网络世界里的:大型十字路口。一个数据中心里面有几千台服务器,它们不可能全部互相直接拉一根线。于是需要交换机来决定:这个数据应该送给谁,那个数据应该送到哪里。
第三个是:光纤。为什么需要光纤?因为数据量越来越大,距离越来越远以后,用光来传输可以获得非常高的速度。
但服务器里面跑的是电信号,光纤里面跑的是光。怎么办?这里又出现一个经常出现在 AI 新闻里的东西:光模块。光模块可以非常简单地理解成:电和光之间的翻译官。
服务器说的是“电”,光纤说的是“光”。光模块负责:电信号 → 光信号。到了另一边再:光信号 → 电信号。
所以当 AI 数据中心里面服务器越来越多,它们之间交换的数据越来越大,交换机、网卡、光模块、光纤这些东西的重要性也就越来越高。你可以把 GPU 看成工人,那么网络就是:工厂里的高速公路。工人能力再强,如果道路天天堵车,整个工厂效率一样上不去。

08 · 第八层:运营商网络——为什么移动、联通、电信也在 AI 产业链里?
数据中心内部的网络解决了,但是数据中心和数据中心之间呢?北京的数据中心怎么和上海的数据中心通信?深圳一家企业怎么访问杭州云上的 AI?
这时候就需要更大的通信网络。中国移动、中国电信、中国联通这些运营商,就是这一层非常重要的参与者。
如果说数据中心内部的网络像:一个工业园里的内部道路。那么运营商的骨干网络更像:全国高速公路。
它们把不同城市、不同园区、不同企业连接在一起。所以 AI 越来越大以后,网络的重要性会继续上升。未来有可能一个超级大的 AI 任务,并不是只在一栋楼里完成,而是需要多个数据中心一起协同。
这时候你会发现:AI 已经不只是“芯片问题”。它同时也是:电力问题、散热问题、服务器问题、通信问题。

09 · 第九层:云计算——为什么普通公司不用自己买一屋子 GPU?
到现在为止,我们已经准备好了:电、数据中心、服务器、GPU、内存、存储、网络。但是如果你是一家只有 50 个人的创业公司,想做一个 AI 产品,难道先花几十亿元建设一个数据中心吗?当然不现实。
于是就出现了:云计算。
云计算可以用一句最简单的话解释:把电脑从“买下来”,变成“租着用”。
以前一家公司要运行网站,先买服务器,再把服务器放进机房,还要招人维护。现在可以直接去阿里云、AWS、微软 Azure、Google Cloud、腾讯云、华为云、火山引擎上:“我要一台服务器。”点一下,几分钟后就有了。
想要 GPU?也可以租。想要存储?也可以租。想要数据库?也可以租。
所以云计算公司真正干的事情就是:提前把这些特别贵、特别复杂的东西建好,然后切成一份一份租给别人。
很像酒店。普通人去北京出差,不会自己在北京盖一栋房子。住三天酒店就够了。云计算其实也是这样。你需要算力的时候,就租;不用的时候,就退。
所以 AI 时代,云计算变得更加重要,因为 GPU 本来就非常贵。对于绝大多数公司来说,自己建设 AI 数据中心并不划算。直接使用云上的算力,反而更容易。

10 · 第十层:数据——GPU 很能算,但它一开始什么都不知道
现在硬件全部准备好了,我们终于可以开始做 AI。但这时候的 GPU 其实一点都不聪明。它只是会算数学题。你给它一张猫的照片,它不知道这是猫;给它一句中文,它也不知道什么意思。
怎么办?要教。这时候就需要:数据。
你可以把训练 AI 想成培养一个孩子。GPU 是他的大脑计算能力,数据则是他从小到大读过的书、看过的图片、听过的话、见过的世界。
比如我们希望 AI 学会中文,就要给它大量中文文字;希望它会写代码,就要给它看大量代码;希望它会看图片,就要给它大量图片以及相应的信息。
所以 AI 的智能并不是凭空出现的。它是:从大量数据里面一点点“学”出来的。
这里还有一个词你以后会经常听到:训练。所谓“训练大模型”,本质上可以非常粗略地理解成:给模型看大量例子,模型猜答案,猜错了就稍微调整自己,再猜,再调整。重复无数次以后,它慢慢学会很多规律。

11 · 第十一层:大模型——“模型”到底是什么?
终于到了大家最熟悉的:GPT、Claude、Gemini、千问、豆包。它们都属于:大模型。
但“模型”到底是什么意思?可以把模型理解成:AI 通过海量学习以后,形成的一套非常复杂的判断规律。
比如一个孩子见过一万只猫。后来你再给他一张从来没见过的猫的照片,他仍然可以说:“这是猫。”他不是把之前一万张照片全部背下来,然后逐张对比,而是慢慢学会了:猫通常有什么特征,这些特征组合在一起以后,大概意味着“这是一只猫”。
AI 模型有点类似。它在大量数据里面不断学习规律,最后把这些规律“压缩”进模型内部数量巨大的数字里面。这些数字就叫:参数(Parameter)。
参数到底是什么?可以把模型想象成一张极其庞大的“关系网络”,里面有无数条连接。每条连接都有一个数字,表示:这条信息到底有多重要,它应该对后面的判断产生多大的影响。这些可以被训练、被调整的数字,就是参数。
比如模型在学习“猫”的时候,它并不是内部专门有一个参数写着“猫有尖耳朵”,另一个参数写着“猫有胡须”。真实情况复杂得多。可能有成千上万个参数一起参与判断:有些参数对形状比较敏感,有些对纹理比较敏感,有些负责不同特征之间的关系。最后大量参数一起作用,模型才形成“这大概率是一只猫”的判断。
所以“几百亿参数”可以理解成:这个模型内部有几百亿个可以通过学习不断调整的小数字。训练模型的过程,很大程度上就是不断调整这些数字。
比如模型猜错了,训练系统会告诉它:“刚才的判断偏了。”然后模型内部大量参数会被非常轻微地调整一点。下一次再遇到类似问题,它的判断就可能稍微准确一点。这个过程重复几万亿次以后,大量参数最终共同形成了模型今天表现出来的语言、知识、推理等能力。
你也可以把参数想象成一个拥有几百亿个旋钮的超级控制台。训练之前,这些旋钮基本没有调好;训练过程中,每看一批数据,就调整一点点。最后几百亿个旋钮全部停在某种组合上,这个组合,就保存了模型从数据中学到的大量规律。
需要特别注意的是:参数不是“规律的维度”。“维度”更像是模型内部表示信息时有多少个方向或者位置,例如一个词可能被表示成几千维的一串数字;而“参数”则是模型用来处理这些数字、决定它们如何相互作用的那些可学习数值。
数据,是模型读过的教材;参数,是模型学完以后留在大脑里的“连接强弱”;模型,则是这几百亿甚至更多参数共同组成的一套复杂判断系统。

12 · 第十二层:Token——为什么 AI 公司总在说“Token”?
还有一个非常常见的词:Token。很多 AI 产品都会按照 Token 数量收费,那 Token 到底是什么?
你可以先把 Token 理解成:AI 阅读和生成文字时使用的“最小处理小块”之一。
人看到一句话,比如:“帮我去冰箱拿一瓶水。”我们会直接理解整句话的意思。但 AI 并不是这样工作的。计算机真正擅长处理的是数字,而不是“文字的意思”。所以在这句话进入模型之前,系统会先把它拆成一个个小块,再把这些小块分别转换成数字。这个“拆成小块”的过程,就叫 Tokenization,也就是分词或 Token 化;拆出来的每一个小块,就是 Token。
这里最容易误解的一点是:一个 Token 不一定等于一个汉字,也不一定等于一个英文单词。
比如英文里的 “apple” 有时候可能是一个 Token,但一个比较长、比较少见的英文单词,也可能被拆成几个 Token。比如一个词可能被拆成“前半部分 + 后半部分”,因为模型没有必要把世界上所有可能出现的单词都单独记成一个单位。
中文也是类似。一个汉字有时候可能对应一个 Token,有些常见词语也可能被作为一个整体处理,还有一些内容可能被拆成不同的小块。具体怎么拆,取决于每个模型使用的 Tokenizer,也就是“切词规则”。所以我们不能简单地说:“一个汉字就是一个 Token”或者“一个单词就是一个 Token”。
可以把 Token 想象成乐高积木。人类看到的是一整栋房子,但模型会先把房子拆成一块一块积木,然后再处理这些积木之间的关系。
比如一句:“我喜欢吃苹果。”模型内部可能会把它拆成若干 Token。这里具体拆成几个,不同模型可能不一样。关键不在于到底是 5 个还是 6 个,而在于:模型不会直接拿整句话去计算,而是先把它拆成自己认识的一组基本单位。
接下来,每一个 Token 还会被分配一个编号。比如可以非常粗略地想象成:“我” → 1024、“喜欢” → 5831、“苹果” → 9274
这里的数字只是为了举例,真实模型里的编号并不是这些。
所以,当一句话真正进入模型时,模型最开始接收到的其实不是“我喜欢吃苹果”这几个汉字,而是一串类似:1024、5831、……、9274这样的 Token 编号。
不过模型也不是直接拿这些编号做复杂推理。编号本身只是“身份证号”,并不包含“苹果是什么”这样的含义。接下来,模型还会把每个 Token 转换成一串更复杂的数字,也就是 Embedding,向量表示。
你可以把它理解成:Token ID 只是告诉模型“这个东西是谁”,Embedding 则进一步告诉模型“这个东西大概是什么意思、和其他东西有什么关系”。
比如“苹果”这个 Token 进入模型以后,会被转成一串数字。经过模型内部大量参数的计算,它会结合上下文判断:这里的“苹果”到底是水果,还是苹果公司。
所以整个过程可以非常粗略地理解成:人类文字 → 切成 Token → Token 变成编号 → 编号变成向量 → 模型开始计算 → 预测下一个 Token。
而大语言模型最核心的工作,其实就是不断做一件事情:根据前面已经出现的 Token,预测下一个最可能出现的 Token。
比如你输入:“今天天气很……”,模型可能会判断,下一个比较可能出现的是:“好”。于是它生成“好”。然后现在上下文变成:“今天天气很好……”,模型再预测下一个 Token。可能是“,”。再继续预测下一个。就这样一个 Token、一个 Token 地往后生成,最后才变成我们看到的一整段自然语言回答。
所以你感觉 AI 好像“一下子写出了一整篇文章”,实际上在底层,它更像是在高速进行:预测一个 → 再预测一个 → 再预测一个……只不过速度太快,我们看起来像是它在连续写作。
这也解释了为什么 AI 产品经常按照 Token 收费。因为对于模型来说,真正需要计算的不是“你发了几句话”,而是:它一共处理了多少 Token。
这里通常又分成两部分。第一部分是输入 Token,也就是你发给 AI 的内容,包括你的问题、前面的聊天记录、系统给它的背景资料、上传文件中被送进模型的内容等。第二部分是输出 Token,也就是 AI 最后生成给你的回答。
比如你只问了一句话,但前面已经和 AI 聊了几十轮,那么模型这一次可能还要读取大量前文,所以真正消耗的 Token 可能远远超过你最后输入的那一句话。
这也是为什么一个对话越来越长以后,AI 每次回答的计算成本可能会变高:它需要处理的上下文越来越多。
因此,以后看到 AI 厂商写:“输入每百万 Token 多少钱,输出每百万 Token 多少钱。”可以把它理解成:AI 每读这么多内容,要收多少钱;每生成这么多内容,又要收多少钱。
所以 Token 本质上既是 AI 处理语言时的基本单位,也是今天大模型行业衡量计算量和收费的重要单位之一。
人类用“字、词、句子”理解语言,而大模型先把语言拆成 Token,再把 Token 变成数字,一块一块地计算。所以 Token 可以理解成:AI 世界里的“文字积木”。

13 · 第十三层:推理——模型训练完以后,每次回答你也还要计算
这里还有两个特别容易混淆的词:训练和推理。
训练,是上学。推理,是上班。
一个模型训练的时候,需要大量数据和大量 GPU,让它慢慢学会能力。训练结束以后,模型已经“毕业”。但你每次问它问题的时候,它还是需要计算答案。这个过程就叫:推理,Inference。
所以你今天给 AI 发一句:“帮我去冰箱拿瓶水。”模型理解你的意思、判断任务、生成下一步动作的过程,都属于推理。
未来 Agent 越多,机器人越多,AI 每天真正“工作”的时间越长,推理需要的算力也可能越来越大。

14 · 第十四层:多模态——机器人为什么不仅要“会说话”,还要“会看”?
但是如果想让机器人真的去冰箱拿水,只会文字肯定不够。它还需要看到现实世界。
所以 AI 又发展出了:多模态。
“模态”这个词听起来很专业,其实可以理解成:信息的不同形式。文字是一种,图片是一种,声音是一种,视频也是一种。
所以所谓“多模态 AI”,就是说:这个 AI 不只是看文字,它还会看图片、听声音、理解视频。
比如机器人站在厨房里面。摄像头看到:桌子、椅子、冰箱、杯子。模型需要理解:哪个是冰箱?冰箱门在哪里?这里有没有障碍物?打开以后,哪瓶是水?这就是视觉能力。
你对它说:“帮我拿瓶水。”它还要通过麦克风听到你的声音,再理解你说的是什么意思。这就是语音能力。
所以未来机器人背后的模型,很可能不是一个单纯的“语言模型”,而是:能听、能看、能理解很多种信息的多模态模型。

15 · 第十五层:知识库与 RAG——AI 怎么知道最新发生了什么?
现在的大模型已经很聪明了,但它还有一个非常现实的问题:它不可能什么都知道。比如昨天你们公司刚刚签了一份新合同,今天早上销售团队更新了一份客户名单,下午产品经理又在内部 Wiki 里修改了一版产品说明。这些信息,大模型在以前训练的时候根本没有见过。所以你问 AI:“我们公司上季度销售额最高的五个客户是谁?”或者“我们最新的退款政策是什么?”它不能只靠自己脑子里的知识回答。
这时候,就需要给 AI 接一个属于你自己的“资料室”。这个资料室现在经常被叫做 Knowledge Base,也就是知识库。知识库里面可以放很多东西,比如公司的 Wiki、钉钉文档、飞书文档、Word、PDF、产品手册、合同、邮件、数据库、CRM 客户信息、内部网页,甚至 GitHub 里的代码。
这里有一个很容易混淆的地方:Wiki 和 RAG 并不是二选一。Wiki 更像是一个书架,比如公司员工把各种制度、产品介绍、操作手册写在 Confluence、Notion、钉钉知识库或者飞书知识库里面,这些地方负责“把资料存好”。而 RAG 更像是这个图书馆里的图书管理员。你走进去问:“我们公司现在出差去美国,酒店标准是多少?”图书管理员不会把整个图书馆几十万本书全部搬到你面前,而是先理解你的问题,然后找到最相关的几页资料,把这几页递给你,AI 再根据这几页资料回答。
这就是 RAG 最核心的思想。RAG 全称叫 Retrieval-Augmented Generation,检索增强生成。名字听起来很复杂,其实可以拆成两个动作:先检索,再生成。也就是先去找资料,再让大模型根据资料回答。所以以前说“普通大模型像闭卷考试,RAG 像开卷考试”,这个理解到现在依然成立。
只不过,今天真正的企业 AI,已经比最早的 RAG 复杂很多了。早期 RAG 的方式比较简单。比如公司有 1000 份 PDF,系统先把这些 PDF 切成很多小段,把每一段变成向量,然后存进向量数据库。用户问:“公司的退款政策是什么?”系统就把这个问题也变成向量,再从数据库里找出“意思最接近”的几段文字,然后把这些内容交给大模型,让它根据资料回答。这就是最经典的一代 RAG。
但后来大家发现,只靠这种方式还不够。比如你问:“比较一下我们华南区今年前三个月销量下降最大的三个产品,并结合最近销售会议里的反馈分析原因。”这个问题已经不是简单搜一段 PDF 就能解决了。AI 首先要知道,“华南区前三个月销量”应该去业务数据库里查;“销量下降最大的三个产品”还需要做计算和排序;而“最近销售会议里的反馈”可能又存在 Wiki、会议纪要或者文档知识库里。
于是现在更先进的做法开始变成:让 AI 自己决定去哪里查。它可能先把一个大问题拆成几个小问题,第一个去查数据库,第二个去搜 Wiki,第三个去看会议纪要,最后再把这些信息拼起来做分析。这个方向现在经常被叫做 Agentic Retrieval,可以理解成“Agent 式检索”或者“智能体式检索”。
传统 RAG 比较像:“你问一个问题,我帮你搜一次资料。”而 Agentic Retrieval 更像一个真正的研究助理。你给它一个复杂问题以后,它会先判断:这个问题实际上包含几个小问题?哪些应该去数据库查?哪些应该搜索文档?哪些可能需要联网?如果第一次搜出来的信息不够,它甚至可以换个关键词再查一次,最后再把不同来源的信息组合起来。
所以现在企业 AI 更真实的知识架构,大概变成了这样:用户提出问题 → AI 理解问题 → 判断需要哪些资料 → 去不同知识源检索 → 找出最相关的信息 → 排序和筛选 → 再交给大模型生成答案。
这里的“知识源”也不只是 Wiki。Wiki 和文档知识库适合查公司的制度、产品文档、会议纪要;向量数据库适合按照“意思”搜索大量非结构化文字;关键词搜索适合查产品型号、人名、订单号这种非常具体的词;业务数据库适合回答“销售额多少”“最大的五个客户是谁”这种需要精确数字的问题;CRM、ERP 适合查询真实业务状态;互联网搜索适合查最新新闻、政策和市场信息;如果问题涉及复杂的人物、企业或者上下游关系,还可能用到 Knowledge Graph,也就是知识图谱。
所以现在成熟的企业 AI 系统,通常不会把“所有东西全部向量化,然后丢进一个向量数据库”当成最终方案。不同问题,需要使用不同的检索方式。比如你问“退款政策里面有没有写 7 天”,直接关键词搜索可能最快;如果问“哪些制度和远程办公有关”,按照语义搜索,也就是向量搜索,会更合适;如果问“今年销售额最高的五个客户是谁”,那就应该直接查询数据库,而不是让 AI 在几千份文档里面猜。
如果问题更复杂,比如“为什么今年最大的几个客户采购量下降了”,AI 可能会先去数据库里找出这些客户,再到 CRM、会议纪要、Wiki 甚至邮件里面寻找原因。也就是说,现在越来越多系统采用的不是单一搜索,而是 Hybrid Search,混合检索,把关键词搜索和向量搜索结合起来。
Wiki 像书架,数据库像账本,CRM 像客户档案,向量数据库像按“意思”分类的资料柜,而 RAG 和 Agentic Retrieval 则像一个越来越聪明的图书管理员。大模型负责思考,而这一整套知识层负责告诉它:“在回答这个问题之前,你应该先知道哪些真实事实。”

16 · 第十六层:Embedding 和向量数据库——AI 是怎么“按意思找资料”的?
上面有提到两个词:Embedding,向量化。它们经常和 RAG 一起出现。
可以用一个非常生活化的方式理解。传统搜索特别像:按照字面找词。
比如你搜索:“怎么让员工更开心?”但一篇文章里面写的是:“提高职场幸福感的方法。”里面根本没有“员工更开心”这几个字,传统关键词搜索有时候就不容易找到。
Embedding 做了一件很神奇但又很好理解的事情:把一段文字的“意思”,变成一串数字。
意思越相似的内容,在这个数字空间里就会越靠近。所以:“员工更开心”和“提高职场幸福感”,虽然字完全不同,但含义比较接近。AI 就更容易把它们找到一起。
存这些“意义数字”的数据库,就经常被叫:向量数据库。所以向量数据库你也不用想得特别复杂。可以把它理解成:一个不只是按照关键词找东西,而是可以按照“意思”找东西的资料库。

17 · 第十七层:MCP 和 API——AI 怎么伸手去使用外面的软件?
模型会思考了,也可以查资料了。但如果它真的要干活,还得能操作外面的东西。比如打开日历、发送邮件、查询数据库、操作 GitHub、调用地图、打开 CRM。
这时候就涉及:API。API 可以理解成:软件给另一个软件开的服务窗口。
就像你去银行,不需要冲进后台机房自己改数据库。银行给你一个柜台。你告诉柜台:“我要转账。”柜台按照规定帮你操作。API 就类似软件之间的“办事窗口”。
而经常听到的:MCP。也可以非常粗略地理解成:希望给 AI 连接各种工具提供一套更统一的插口。
以前连接不同软件,很像每一个电器都有一种完全不同的插头。连接 GitHub 一个接口,连接数据库另外一个,连接文件系统又另外一个。MCP 想做的事情有点像:给 AI 世界做一个越来越通用的插座。
模型有了这些“手”,才真正开始有能力影响外面的世界。

18 · 第十八层:Agent——AI 从“告诉你怎么做”,变成“真的替你做”
现在我们终于走到了 Agent。Agent 是我最喜欢的一个词,但其实它最好理解。
你问普通大模型:“怎么订一张明天去上海的机票?”它会告诉你订票的步骤。这叫:给建议。
如果是 Agent,你告诉它:“帮我看看明天下午去上海有哪些合适的航班,选三班给我比较。”它可能自己打开航班系统,搜索、比较、整理、并给你确认后直接下单。
这时候它已经不只是“回答问题”,而是在:完成任务。
所以 Agent 可以理解成:拥有大模型大脑,同时还能自己调用工具、执行多个步骤的 AI。
一个比较典型的 Agent 工作过程可能是:你给目标,它先理解目标,然后自己拆任务,再搜索资料,调用工具,查看结果,发现不对,再修改计划,最后给你交付成果。
所以以前的软件是:你一步一步操作软件。Agent 更像:你告诉 AI 最终想要什么,让 AI 自己操作软件。这是一个非常大的变化。

19 · 第十九层:Memory——为什么真正的 AI 助手必须“记得你”?
但是一个真正的 Agent 还需要:Memory,记忆。
没有记忆的 AI 很奇怪。你今天告诉它:“我不喜欢喝冰水。”它说知道了。明天你说:“帮我拿瓶水。”它又给你拿一瓶刚从冰箱冷冻室出来的。因为它把昨天忘了。
所以真正长期服务你的 AI,需要慢慢知道:你是谁,你喜欢什么,你正在做什么项目,哪些事情已经完成,哪些事情还没完成。
所以未来真正好用的 AI 助手,很可能不是每次聊天都从零开始,而会越来越像一个长期和你共事的人。这也是为什么:记忆系统会成为 Agent 非常重要的一部分。

20 · 第二十层:Agent Harness——谁在真正指挥 Agent 干活?
前面我们已经讲了 Agent。大模型像大脑,API、MCP 让它可以调用工具,Memory 让它记得过去。听起来好像已经齐活了,但这里还有一个很现实的问题:到底是谁在组织这些能力,让 Agent 真正连续工作起来?
比如你告诉一个 Agent:“帮我研究一下最近新能源汽车行业的变化,最后给我做一份报告。”它可能要先搜索网页,再看几份 PDF,再整理数据,再运行代码,最后生成报告。这个过程可能有几十步。中间某个网页打不开怎么办?搜索结果不够怎么办?它怎么知道下一步该干什么?什么时候应该继续?什么时候应该停下来?调用危险工具之前要不要先问你?聊得太久以后,上下文太长怎么办?
这些事情不能全部指望大模型自己凭感觉处理。所以现在 Agent 外面通常还会包着一层非常重要的系统,叫做:Agent Harness。
Harness 这个词本来的意思有点像“安全带”“马具”或者“把东西固定住的一套装置”。放在 AI 里面,你可以把它理解成:给 Agent 搭的一整套工作框架。
如果说大模型是一个非常聪明的员工,那么 Harness 就有点像:这个员工所在公司的工作制度、任务管理系统、工具箱、权限系统和监督机制全部加在一起。
比如 Agent 接到“帮我做行业报告”这个任务以后,Harness 可能会负责让它先列一个计划:第一步搜新闻,第二步读财报,第三步整理数据,第四步写报告。Agent 每完成一步,Harness 就记录当前进度,然后再决定下一步是不是继续。
如果 Agent 需要搜索网页,Harness 负责把搜索工具提供给它;如果需要运行 Python,就给它代码工具;如果要修改文件,就让它访问文件系统。工具执行完以后,Harness 再把结果送回模型,让模型继续判断下一步该做什么。
如果某一步失败了,比如网页打不开,Harness 还可以让 Agent 重试、换一种方法,或者告诉模型:“刚才这条路失败了,重新想办法。”
如果 Agent 想执行一个危险操作,比如删除文件、发送邮件、修改数据库,Harness 还可以设置一条规则:这种操作必须先经过人的确认。
如果整个任务特别长,前面已经聊了几十万字,Harness 还可以帮它整理上下文,把不重要的信息压缩掉,把真正关键的内容保留下来,不然模型最后连自己做到哪一步都可能记不清。
所以一个比较完整的 Agent Harness,通常会管很多事情:任务循环、计划、工具调用、上下文管理、记忆、任务状态、权限、安全、失败重试、结果验证、日志和监控。
你可以把它理解成:大模型决定“我想怎么做”,Harness 负责“让这件事真的稳定地跑起来”。
这也是为什么现在大家越来越发现,Agent 能力强不强,已经不只是看底层大模型聪不聪明。同一个模型,放在不同的 Harness 里面,最终表现可能差很多。
就像把同一个非常聪明的员工放进两家公司。一家公司没有任务管理、没有资料系统、没有权限管理、没有复盘机制,什么都靠员工自己记;另一家公司把资料、工具、流程、权限、工作台全部准备好了。即使员工本身能力一样,最后能完成的复杂任务也可能完全不同。
所以今天越来越多人开始说:Agent 不只是 Model。更接近:Agent = Model + Tools + Memory + Context + Loop + Rules。而把这些东西真正组织起来的那一层,就是 Harness。
大模型是大脑,Agent 是会干活的人,Harness 则是让这个人能够长期、稳定、有规则地干活的“工作系统”。

21 · 第二十一层:具身智能——给 Agent 装上眼睛、手和脚
理解了Agent以后,我们再往上走就非常自然了。现在这个 Agent 已经有大脑、有记忆、有工具,还有一整套 Harness 帮它持续工作。
但它依然有一个问题:它还是只能活在电脑里面。如果我们想让它真的打开冰箱、拿起水瓶、走到你身边,就需要再给这一整套 Agent 系统装上一个真实的身体。
怎么办?给它一个身体。这就是:具身智能。
“具身”这两个字听起来特别学术,其实意思非常简单:智能有了一个可以在现实世界活动的具体的身体。
摄像头是什么?眼睛。麦克风是什么?耳朵。扬声器是什么?嘴巴。机械臂是什么?手。轮子或者双腿是什么?脚。触觉传感器是什么?皮肤。电机是什么?肌肉。电池是什么?体力。大模型和 Agent 系统是什么?大脑。
把这些东西结合起来,就是一个真正意义上的智能机器人。
所以:Agent,是活在电脑里的 AI。具身智能,是走出电脑的 Agent。

22 · 第二十二层:机器人到底怎么完成“帮我拿瓶水”?
现在我们终于可以把文章开头那句话完整跑一遍。
你坐在沙发上说:“帮我去冰箱拿瓶水。”
第一步,机器人的麦克风听到声音,AI 把声音识别成文字。第二步,大模型理解:主人想喝水。第三步,机器人利用记忆系统知道:你不喜欢冰水,所以它不能直接拿太冰的。第四步,摄像头看到房间,视觉模型识别:沙发、桌子、厨房入口。第五步,Agent 开始规划:先走到厨房,找到冰箱,打开门,找到矿泉水,拿出来,回来。
第六步,机器人控制自己的双腿或者轮子前进。第七步,到冰箱前以后,摄像头判断把手在哪里,机械臂伸过去。第八步,打开冰箱以后,它看到:牛奶、可乐、矿泉水。视觉模型判断:主人要的是矿泉水。第九步,机械手抓住瓶子,力度不能太轻,不然掉下来,也不能太重,不然可能捏坏。第十步,它拿着水回来,最后把水递给你。
你只说了九个字:“帮我去冰箱拿瓶水。”但背后其实经历了:语音识别、大模型理解、记忆、视觉识别、任务规划、路径规划、机器人控制、机械臂控制,最终才完成现实世界里的动作。
这就是为什么具身智能很难。因为它不是单独解决“机器人”问题,而是要把前面几乎整条 AI 产业链全部串起来。

23 · 第二十三层:那 AGI 又是什么?
最后还有一个大家特别喜欢讨论的词:AGI。AGI 全称是 Artificial General Intelligence,中文一般翻译成:通用人工智能。
但 AGI 和我们前面讲的 GPU、Agent、机器人其实不是同一类东西。GPU 是一种硬件,Agent 是一种 AI 系统形态,机器人是一种可以在现实世界行动的设备,而 AGI 更像是一个能力目标:我们希望有一天,AI 不只是特别擅长某一类任务,而是能够像人一样,在很多完全不同的任务之间灵活切换,遇到以前没见过的问题,也能够自己理解、学习和解决。
今天的 AI 已经非常厉害了。它可以写代码、看图片、做数学题、搜索资料,也可以通过 Agent 调用工具完成复杂任务。但它依然经常存在明显边界。比如一个 AI 可能特别会写代码,却不一定真的理解现实世界里的物理常识;它可能能完成一个已经设计好流程的任务,但遇到完全陌生的环境时,未必能够像人一样快速学习和适应。
所谓“通用”,最核心的地方就在这里:不是把某一种事情做到特别强,而是面对很多不同类型的事情,都能理解、学习、推理、规划,并把过去学到的能力迁移到新的问题上。
比如一个真正足够通用的 AI,你今天让它帮你研究一家公司的财报,它能做;明天让它第一次接触一个完全陌生的软件,它能够自己摸索怎么用;后天让它学习一种从没见过的游戏规则,它也能够慢慢学会。它不需要每换一个任务,就重新训练一个专门模型。
所以 AGI 不是“比 Agent 再多装几个功能”。一个 Agent 可以很强,但仍然不一定是 AGI。因为 Agent 更多描述的是:AI 能不能围绕一个目标,自主调用工具、执行多个步骤,把任务真正完成。而 AGI 描述的是:这个 AI 的智能到底有多通用,它能不能在广泛、陌生、变化的任务中持续学习和适应。
你可以把两者的关系理解成:Agent 是一种“工作方式”,AGI 是一种“智能水平”。
今天的 Agent 已经可以包含大模型、Memory、工具调用、RAG、MCP、Harness 等一整套能力。它可以像一个数字员工一样完成很多任务。但今天大多数 Agent 的能力仍然高度依赖底层模型、预先提供的工具、规则和工作环境。换一个完全陌生的世界,它未必还能像人一样快速适应。
而如果未来某个 AI 系统真的具备很强的通用学习能力、推理能力、迁移能力、自主规划能力和环境适应能力,那我们才会越来越接近大家所说的 AGI。
如果这个 AGI 只生活在电脑里,它可能是一个非常强大的“数字智能”。如果再给它一个机器人身体,让它能够通过摄像头、传感器、机械臂和双腿感知并改变现实世界,那么它就进一步变成了一个能够在物理世界中行动的通用智能体。
所以:Agent 解决的是“AI 能不能自己把事情做完”;AGI 追求的是“AI 能不能像一个真正通用的智能一样,面对各种新问题都学得会、想得明白、做得出来”。
因此,AGI 并不是 AI 产业链上的某一个具体零件,也不是在 Agent 上面再叠一层软件。它更像是整条 AI 技术路线不断向前发展时,人们想要逼近的那个终极能力目标。

24 · 第二十四层:把整条 AI 产业链重新看一遍
现在我们终于可以重新把整条链串起来了。
电力,解决 AI 有没有能量的问题。数据中心,解决这些机器放在哪里的问题。服务器,是一台台真正工作的专业电脑。CPU,像服务器里的总管,什么事情都能处理。GPU,像一个拥有几千名计算工人的超级工厂,特别适合 AI 的大规模并行计算。内存和 HBM,像 GPU 手边的工作台,负责尽快把数据送给 GPU。硬盘和存储,像仓库,负责长期保存数据和模型。
网卡,是服务器连接网络的嘴巴和耳朵。交换机,是数据中心里的交通枢纽。光模块,负责把电信号和光信号互相转换。光纤,是高速传输数据的道路。运营商网络,则像跨城市、跨地区的高速公路。
云计算,把这些昂贵的机器变成别人可以随时租用的服务。数据,相当于 AI 的教材。大模型,是学习大量数据以后形成的“大脑”。参数,可以理解成这个大脑里面数量巨大的可调旋钮。Token,是模型处理文字时使用的小单位。训练,就是 AI 上学。推理,就是训练完成之后真正开始工作。
多模态,让 AI 不只是会读文字,还会看、会听。RAG,让 AI 可以先查资料再回答。Embedding 和向量数据库,让 AI 可以按照“意思”而不是只按照关键词找资料。API 和 MCP,让 AI 可以连接各种外部软件和工具。Memory,让 AI 能记住过去。Agent,让 AI 从“回答问题”升级成“完成任务”。具身智能,则让 AI 从电脑里面走出来,真正拥有身体。
最终,一整条几十层的技术链路,才变成你面前那个非常简单的结果:
你说:“帮我拿瓶水。”
它真的给你拿来了一瓶水。

25 · 未来:AI 最终可能不是一个软件行业,而是一个“超级产业”
理解完这一整条链以后,再看未来 AI,会出现一个很有意思的现象。AI 越往上发展,反而越会拉动下面所有产业。
Agent 越多,需要的模型推理越多。模型用得越多,需要的 GPU 越多。GPU 越多,需要的服务器越多。服务器越多,需要的数据中心越大。数据中心越大,需要的电越多。服务器之间交流越频繁,需要的交换机、光模块和光纤越多。机器人越多,又会进一步拉动电机、减速器、传感器、电池、摄像头和各种制造产业。
所以 AI 最终可能并不是一个单纯的软件革命。它会同时影响能源、电力设备、半导体、存储、服务器、通信、云计算、数据库、软件、机器人、制造业,甚至未来整个劳动力市场。
过去互联网最大的变化,是把全世界的信息连接起来。而 AI 正在做另外一件事情:先理解信息,再做出判断,再帮助人执行,最后甚至自己进入现实世界行动。
所以今天我们看到的聊天机器人,可能只是 AI 非常早期的形态。今天的 AI 主要住在聊天框里。下一阶段,它可能住进你的电脑,帮你操作软件。再往后,它会进入汽车、工厂、商场和医院。再往后,它可能真的拥有一双手和一双腿。
到那个时候,再回头看今天,我们可能会发现:ChatGPT 真正重要的地方,并不是“出现了一个特别会聊天的软件”,而是从那以后,人类第一次开始大规模尝试把一种新的东西生产出来:智能。
而整个 AI 产业链,本质上就是一个越来越庞大的“智能生产系统”。它从一度电开始,经过服务器和 GPU,变成算力;算力经过数据和模型,变成智能;智能通过 Agent,变成任务;最后,智能进入机器人身体,变成现实世界里的行动。
所以如果一定要用三句话概括整个 AI 产业链,我想说:第一步,把电变成算力。第二步,把算力变成智能。第三步,把智能变成行动。
而我们今天正在经历的,可能正是从第二步,开始走向第三步的那个时代。
