模型家族 · 底层逻辑

Grok 模型家族:马斯克用造火箭的办法做大模型

迟到三年,追进第一梯队。靠的不是运气,是三张牌:算力先行、押注强化学习、绑定 X 生态

2026-09-14大模型 · 技术脉络约 18 分钟

01迟到三年的玩家,凭什么挤进第一梯队?

牌桌上的人都落座了,才有人推门进来——三年后,他坐进了头排。

2023 年 11 月,Grok-1 上线。发布方式低调得不像马斯克:作为 X 平台 Premium+ 订阅的一项附带福利,悄悄开放。那时候 ChatGPT 已经跑了一整年,插件商店都开过又关了;Llama 和 Claude 也各自立住了山头。没人把 Grok 当回事。

两年零十个月后,2026 年 9 月,微软宣布把 Grok 装进 Word、Excel 和 PowerPoint。再往前一个月,Grok 4.6 已经躺在 Amazon Bedrock、Microsoft Foundry、GitHub Copilot 的货架上,跟 GPT、Claude、Gemini 摆在同一排。按 SpaceX 招股文件的口径,Grok 的月活用户约 1.17 亿。

从无人在意,到被所有巨头请上货架,用了不到三年。

这中间发生了什么?多数人的第一反应是"马斯克有钱"。钱确实重要,但钱不是答案——烧了钱没烧出结果的 AI 公司,名单能拉出一页纸。真正的差别在方法。

把 Grok 家族从 Grok-1 到 Grok 4.6 的三年拆开看,路线其实很清楚:算力先行的工程方法论,押注强化学习的训练路线,绑定 X 生态的数据与分发。三张牌,一张一张打。

打牌之前,先看出身。出身决定了它为什么非这么打不可。

02Grok 是从哪冒出来的?

一个从科幻小说里借来的名字,一个从 OpenAI 恩怨里长出来的公司。

名字先有意思。Grok 不是马斯克发明的词,它出自科幻作家罗伯特·海因莱因 1961 年的小说《异乡异客》。书里的火星人有个动词"grok",字面意思是"喝水",引申义是"彻底领会"——不是知道,不是了解,是把一个东西喝进身体里,让它变成自己的一部分。

马斯克给模型起这个名字,野心写在词源里。

再往前翻恩怨。2015 年,马斯克是 OpenAI 的联合创始人。2018 年,他退出董事会。理由后来反复讲过:OpenAI 从非营利转向营利,并且在他看来,正在训练一批"政治正确"的 AI。他要的相反——一个"最大限度求真"的 AI,哪怕它说话难听。

2023 年 7 月,xAI 成立。团队从 DeepMind、OpenAI、特斯拉、微软一路挖人,攒出业内少见的豪华班底。四个月后,Grok-1 发布。

发布姿态就带着差异。别的模型小心翼翼绕开的尖锐话题,Grok 被设定为可以答,而且带着点讽刺和幽默感去答。"敢说"从第一天起就是产品的一部分——后来它既是流量的来源,也是事故的来源。

有一个容易被忽略的细节:xAI 起跑的时候,芯片、数据、机房、人才,样样落后。真正不缺的只有两样:敢押注的资本,和马斯克在 SpaceX、特斯拉验证过二十年的那套工程方法论——目标定死,时间倒排,能省的流程全省。

2023 年底的牌面就这些。接下来的第一张牌,也是最不像"AI 公司"打法的一张:先别急着训模型,先盖机房。

03第一张牌:算力怎么先行?

别人两年建成的机房,它 122 天建成——秘诀土得掉渣。

2024 年 6 月,xAI 宣布在田纳西州孟菲斯建 Colossus 超算。选址不是什么科技园区,是一家倒闭的 Electrolux 电器旧工厂。废弃厂房的地基、电力接口都是现成的——省下的不是施工费,是以年计的审批和新建时间。

行业惯例里,一座十万卡级别的算力中心要建多久?同等量级的建设,OpenAI 的配套周期约 2.1 年,亚马逊与 Anthropic 约 1.9 年。Colossus 一期:122 天。

怎么做到的?答案土得掉渣:不讲精致,只讲速度。大型电源机柜和 GPU 用起重机和叉车直接就位,工人像组装游戏 PC 一样逐台通电;市电不够,特斯拉的 Megapack 储能柜先顶上;配套变电站扩容完成之前,储能与临时电源轮班撑住训练。传统数据中心建设里那些"体面"的环节——冗余设计、分期验收、园区美化——能砍的全砍。

孟菲斯人对这座工厂的印象很直接:白天重卡排队进场,晚上灯火通明,几个月里多出来一栋日夜嗡嗡作响的建筑。一期 10 万块 H100,2024 年 9 月通电,立刻投入训练。三个月后规模翻倍,20 万卡。2026 年 1 月,Colossus 2 上线,功率上探 1 吉瓦——xAI 同时还在得州物色更大的地块。

这笔账的意义要看懂。大模型公司的通常节奏是"模型牵引算力":训到哪一步,扩到哪一步。xAI 反过来,"算力牵引模型":先把机房堆到别人两倍的规模,再逼着算法团队把算力吃干净。

这带出一个不舒服但真实的结果:Colossus 建成时,xAI 还没有配得上它的模型。20 万卡的集群每空转一天,都是七位数的电费账单。压力全部给到训练侧。

怎么把这么多算力烧出效率?这就是第二张牌:别人把新增算力继续砸进预训练,xAI 把它砸向了强化学习。

04第二张牌:训练路线押了什么注?

预训练的天花板肉眼可见时,xAI 把算力换了一条赛道烧。

先补一句背景。2023 到 2025 年,行业主流范式是"下一个词预测"(next-token prediction):模型读遍互联网文本,学会猜下一个词。这条路的天花板取决于两件事——数据还有多少,算力还有多少。到 2025 年,两样都在变贵,收益却在变平。

Grok 3 把这条老路走到了当时的极限。2025 年 2 月发布,官方说法是预训练规模"前所未有"。但真正埋下伏笔的是同期的 Grok 3 Reasoning:用强化学习(RL)教模型"想久一点再作答",准确率明显抬升。

xAI 团队在训练曲线上注意到一个趋势:RL 的收益随算力增长,坡度比预训练陡。

于是 Grok 4 做了个大转向——把强化学习放大到预训练的量级。在 20 万卡的 Colossus 上跑 RL,为撑住这个规模,基础设施和算法层面的改造把计算效率提升了 6 倍;可验证数据从数学、代码两个领域扩展到更多学科。所谓可验证,就是答案对错能由机器自动判分的任务——RL 的奖惩信号由此而来,这也是扩展的关键:判不了分的领域,奖励模型教不动。官方口径称,这轮训练消耗的算力比之前高出一个数量级。

另一个关键设计:原生工具使用。Grok 4 在训练阶段就学会调用代码解释器和浏览器,不是上线后再外挂搜索插件。遇到答不了的问题,它自己决定搜什么、搜几轮。

发布时的演示里有个细节。有人问它:"前几天有个疯传的帖子,讲一个跟'腿'有关的字谜,帮我找出来。"这题刁在几乎没法直接检索。Grok 4 先锁定时间窗口,拼出带日期过滤的搜索式,翻出几十条噪音,再从"toe、calf、knee、shin"这几个词反推出这是《纽约时报》Connections 字谜第 756 期,最后定位到那条近九万赞的原帖。全程自己改了四轮搜索词,没有人插手。

再往上一层是 Grok 4 Heavy:多个智能体并行解同一道题,互相辩论后合并结论。在 Humanity's Last Exam——那套逼近人类知识边界、各家得分普遍惨淡的考卷上——Grok 4 Heavy 配合工具拿到 44.4%,当时没有第二个模型摸到过四成。

路线讲完了。把时间轴拉开,看这套打法怎么长出一个家族。

05家族怎么长成今天这个样子?

三年八个主要版本,长得快,但骨架一直是那一套。

先看骨架。

版本发布时间定位
Grok-12023.11初代,后开源权重(314B MoE)
Grok-1.5 / 1.5V2024 上半年128K 上下文 / 视觉理解
Grok-2 / mini2024.8图像生成,实时检索
Grok-32025.2首个完全在 Colossus 上训练的旗舰
Grok 4 / Heavy2025.7强化学习规模化,多智能体并行
Grok 4.12025.11情商与幻觉治理
Grok 4.52026.7新架构,编程智能体
Grok 4.62026.8长周期智能体任务

值得停下来看的有三处。

第一处,Grok-1 的开源。2024 年 3 月,xAI 把初代 Grok-1 的权重挂上 Hugging Face:314B 参数的 MoE 模型,Apache 2.0 协议。这是 Grok 家族唯一开源的一代,此后再无下文,后面每一代都闭源。回头看,那次开源更像迟到者的广告——用"我们也敢开"换一波开发者好感,站住脚就收。马斯克后来的口径也直白:他主张透明,但旗舰不开。

第二处,Grok 4.1 的"情商"。2025 年 11 月发布,方向突然从"会解题"转向"会聊天":EQ-Bench3 情商测试 1586 分,比 Grok 4 高出 380;幻觉率从 12.09% 压到 4.22%。背后是一套代理奖励模型给回复的事实性打分。翻译成人话:光会答竞赛题不够,日常用起来得可靠,得像个人。官方演示的例子是用户说"圣诞节我觉得孤独",它的回复不再是模板句,而是能接住情绪的具体建议。

第三处,Grok 4.5。2026 年 7 月发布,官方称这是家族里第一个完全重新设计架构的版本——1.5 万亿参数的新一代架构。训练数据里掺进了 Cursor 的真实编码行为:数百万开发者怎么修改 AI 生成的代码、怎么 debug、怎么在多仓库之间协作。它学到的不是教科书式编程,而是"真实世界里的人怎么用 AI 写代码"。效果写进跑分:SWE-bench Pro 拿到 64.7%;API 定价压到每百万输入 2 美元、输出 6 美元,同级能力里几乎最便宜。

主干之外,还有一串分工明确的支线:Fast 版换速度,Code Fast 专攻代码,Imagine 管图像视频生成,Voice 管语音对话,Build 做编程智能体。家族长得快,骨架却一直是那一套——旗舰探上限,支线降成本。

模型是发动机。车在哪?第三张牌:生态。

06第三张牌:X 生态绑定了什么?

别的模型公司买数据,它直接买了个数据源——严格说,是后来合的。

数据这层:X 的帖子流是全网最密的实时情绪语料。一条新闻发生后的几分钟到几小时里,X 上已经堆起原始现场、观点交锋和反转再反转。对"实时了解世界正在发生什么"这个卖点,这是独家养料。Grok 4 干脆训出了在 X 内部做关键词与语义检索的专用工具,能翻出几个月前的一条旧帖。

分发这层更狠。X 坐拥数亿用户,任何帖子下面 @Grok 就能提问——不用下载 App,不用注册新账号。别家的聊天机器人都在花钱买量,Grok 出生就站在流量口上。

第三层是硬件。Grok 进了特斯拉车机,车主语音直接唤起。连 Robinhood 的铂金信用卡都把 250 美元的 Robotaxi 乘车额度写进了权益清单——AI 助手与自动驾驶在同一个版图里互相引流。

数字能说明增长:Grok 月活从 2025 年底的约 3500 万,涨到 2026 年 3 月的约 1.17 亿。这个口径含 X 平台内的使用,但增速是真的。

资本层面,这三层被焊死成一坨:2025 年,xAI 收购 X;随后整体并入 SpaceX,成为 SpaceXAI 部门。社交数据、汽车入口、火箭级的算力预算,装进同一张资产负债表。

企业市场是最后补上的一块。Grok 4.6 先后上架 Amazon Bedrock、Microsoft Foundry、GitHub Copilot、Snowflake;2026 年 9 月,微软把它装进 Office 三件套。上架条款里有个细节:因为调用 Grok 时部分客户数据会经 xAI 处理,企业 IT 管理员需要在线服务子处理器名单里主动为员工打开开关,还能查看和控制哪些数据经由 xAI 处理。巨头们一边给 Grok 开门,一边给它拴上链子。

三张牌打完,牌桌另一头的问题就该来了:这套打法,天花板在哪?

07合账:这套打法的天花板在哪?

三张牌能追平迟到的一年,但反超需要的不是这一代的货架。

第一道坎,是"敢说"的成本。人设换来流量,也换来事故:训练数据污染让 Grok 一度在南非政治话题上口无遮拦,图片编辑功能被拿去伪造不雅照,xAI 一次次紧急收紧权限。每出一次事,企业客户的采购部门就多犹豫一分。这也是微软上架时坚持套上治理框架的原因——Grok 进 Office 的前提,是微软而不是马斯克说了算。

第二道坎,跑分强、手感差。Grok 4.X 几轮更新下来,马斯克自己都承认 Grok 4.3 存在数据缺陷,编程的实际表现追不上 Claude。他的药方很有个人风格:跟 Cursor 合作灌真实代码数据,传闻还要直接收购。按他最新的预告,又一个大版本已经训完,"三四周内发布"——这类 deadline,听一半即可。

第三道坎,绝对体量。ChatGPT 月活超 10 亿,Gemini 数亿量级;Grok 的全球网页访问份额还停在低个位数,只有美国市场明显高一些。增速快,盘子仍小。

第四道坎,Grok 5。官方说法是在吉瓦级的 Colossus 2 上训练,发布窗口从 2026 年上半年一路后移,至今没有准信。多智能体加吉瓦算力这条路线如果兑现不了,三张牌里的两张都要打折。

合账的话说穿了很简单:Grok 家族证明了工程速度、算力豪赌加上生态绑定,能把迟到的一年追回来。但它还没证明这套打法能反超——反超需要的是下一代的成功,不是这一代的货架。

Grok 5 落地那天,值得再看一眼这张牌桌。