Kimi-K3 为什么这么强?两件事同时做到极端
K3 不是“突然靠某个黑科技变强”,而是把 两件事同时做到极端 。
架构创新(KDA + AttnRes + Stable LatentMoE)让 2.8T 模型能被训练和部署 ;真正把它变成强 Coding/Agent 模型的,更多是 大规模数据、环境交互训练和推理预算 。
构
可扩展架构撑起巨大稀疏容量
KDA×AttnRes×LatentMoE → 2.8T MoE
序列、深度、宽度三个瓶颈各被一个模块解开,综合 ~2.5× scaling 效率 —— 896 选 16 的 2.8T MoE 。
算
高推理时计算
输出 token ≈ 同类 2×
默认最高推理档,Agent Harness 放大能力。
先看一个数字:训练效率 ≈2.5×
2.5×
整体 scaling 效率 (相对 K2,官方口径)
同一笔训练预算,K3 能学出 2.5 倍 的「有效能力」。
2.5× 从哪来 · 四个技术模块的贡献(按对数贡献占比)
KDA长上下文注意力 ≈1.83× · 占 66% §①
AttnRes深度残差 ≈1.20× · 20% §②
Stable LatentMoE稀疏宽度 ≈1.08× · 8% §③
训练与数据配方Muon/课程/轨迹 ≈1.053× · 6% §④⑤
对估值意味着什么 训练效率 2.5× ≈ 单位能力的训练成本降到约 1/2.5 。同样的 GPU 预算,K3 能站上 2.8T 这个别人烧不起的规模,并把省下的钱转投到 Agent/Coding 的数据与 RL 上。
但必须诚实标注口径 「2.5×」是官方对外说法,尚无公开的逐模块消融 ;下面每一章给出的 1.83× / 1.20× / 1.08× / 1.053× 都是基于公开论文数据的反推与估算 (会逐条标口径)。
① KDA:为什么它能把训练效率拉到 1.83×
KDA 的效率账
≈1.83×
占 2.5× 的 约 66%
1.68×(更便宜)× 1.09×(更聪明)≈ 1.83×。 前者来自把长上下文成本从平方压成近线性、同算力多训 1.68× 数据;后者来自细粒度门带来的更高学习效率。
口径: 基于公开论文数据的反推估算 (假设了偏长的训练分布),非官方消融——数量级判断,完整推导见文末 §⑧。
四个公开数字来自 Kimi Linear 受控对照(arXiv:2510.26692),验证 KDA 架构本身收益;K3 用同源架构,端到端数字官方未逐项公开。
① 为什么更便宜 → 1.68×
打个比方: 传统注意力像每读一个新词都把整本书从头翻一遍 ——上下文越长每步越慢,成本随长度平方($O(n^2)$) 膨胀。KDA 换成随身带一个固定大小的笔记本 ,大多数时候只查笔记、偶尔翻回原书核对,于是上下文再长,每步成本几乎不变 。
给两种架构各写出「单 token 成本」公式 ,代入各档长度、按一个偏长的训练分布加权平均 ,两者一比就是 1.68× 。
全注意力(成本随长度线性涨)
$c_{\rm MLA}(n)=1+\dfrac{n}{40\text{K}}$
KDA(斜率砍到 0.35,几乎压平)
$c_{\rm KDA}(n)=1+0.35\cdot\dfrac{n}{40\text{K}}$
$n$ = 上下文长度
40K =「注意力开始主导」的临界长度
0.35 = KDA 只剩约 1/4 层保留平方复杂度的等效斜率系数
按预训练数据长度配比,加权计算两种注意力的单 token 成本
上下文长度 占比(假设) 全注意力成本 KDA 成本
8K 40% 1.2 1.07
32K 42% 1.8 1.28
128K 15% 4.2 2.12
1M 3% 26 9.75
加权平均 100% 2.65 1.58
2.65 ÷ 1.58 ≈ 1.68×
全注意力平均每 token 成本 2.65,KDA 只要 1.58——同样算力能多训 1.68× 的数据 。这是效率账的第一层(算力账)。
全注意力(虚线)随长度爆炸式上升 ,Kimi Linear(实线)几乎压平——1M 上下文快 6.3× 。这是推理 速度;训练侧同理。
② 为什么便宜还不掉智商 → 再 ×1.09(核心技术)
便宜的记忆表通常「记不准」。KDA 的核心技术 是把遗忘做到每个通道单独可调 :前代(Gated DeltaNet)用一个标量 遗忘门,整表统一衰减;KDA 换成对角门 Diag(α) ——每个 key 通道各有自己的遗忘率 ,正在写的函数签名几乎不忘、无关旧上下文快速淡出。这就是「便宜也能记得准」的来源,也是 KDA 收敛更快、长上下文更稳的核心。
一次 KDA 更新:记忆表怎么被改写(看格子变化即可,β=0.7 举例)
公式 St =(I−βkkᵀ)·Diag(α)·St-1 +βkvᵀ 的三个算子,从右往左作用
S t = (I − β k kᵀ) ② · Diag(α) ① · S t-1 + β k vᵀ ③ 矩阵从右往左作用:①先遗忘 → ②再擦除 → ③后写入
旧笔记 St-1 (当前状态) ① 细粒度遗忘 每行按自己的 α 变淡 ② 按 β 比例擦除 k 那行 ×(1−β) 削弱,非清零 ③ 写入新值 = St 残留 (1−β)旧 + β新,插值
k
k
k
k
已存旧关联(蓝)
本步新写入(绿)
当前 key k 指向的行
图:每来一个 token,记忆表就走三步——① 每行按自己的率遗忘 (这就是「细粒度对角门」的直观样子)→ ② 把当前 key 那行按 β 比例削弱 (残留 (1−β) 倍,不是清零)→ ③ 写入新值 ,该行成为「旧值 + 新值」的插值。全注意力要存下每个 token,KDA 只把这张固定大小 的表原地改写一次。
② AttnRes:让网络叠得更深还不糊 → 1.20×
≈1.20×
等效算力增益 约占 K3 总提升的 20%
打个比方: 等权残差像一场不断加人的大会,每个新发言者都要把
前面所有人 的话等音量重播一遍——开到 100 层谁都听不清;AttnRes 给每层配个
主持人 ,把有用的几层调大、没用的调小。
口径:论文 scaling law 实测 gross 1.25×,与 KDA 部分重叠,保守折算净 1.20×。
病根:等权累加,越深越糊
标准残差每层固定加一个单位权重:$h_l = h_{l-1} + f_l(\cdot)$,幅度随层数 $O(L)$ 无控增长,PreNorm 只能靠归一化稀释早层 。佐证:很深的模型剪掉不少中间层往往掉点不明显——说明大量层其实"糊在一起"是冗余。
核心:把"累加"换成"注意力"
让每层对前面所有层做一次 softmax attention,自己决定听谁:
$$h_l = \sum_{i<l}\alpha_{i\to l}\,v_i,\qquad \alpha_{i\to l} = \mathrm{softmax}_i\!\left(w_l\cdot k_i\right)$$
$w_l$ 是每层一个可学习的 pseudo-query(伪查询)——额外开销仅此一项 ,几乎不加参数,却把"被动等权继承"变成"主动按需检索历史"。
h4 = Σ i αi→4 vi , αi→4 = softmax( w4 · ki )
① 每层的 k, v
② w₄·kᵢ 点积得分
③ softmax→αᵢ
④ Σαᵢvᵢ=h₄
w4
第4层 pseudo-query k1
v1
第1层 w4
·
k1 = 1.27 softmax 0.47 ×v1 k2
v2
第2层 w4
·
k2 = 0.70 softmax 0.15 ×v2 k3
v3
第3层 w4
·
k3 = 1.16 softmax 0.38 ×v3 α1 v1 α2 v2 α3 v3 h4
同一个 pseudo-query w₄ 分别与每层 kᵢ 点积 → 得分 → softmax 成 α → 按 α 加权叠成 h₄
w₄ 是第4层唯一可学习的向量(pseudo-query),它决定「听哪层」;标准残差没有它,只能 α=1/L 等权
把公式 $h_l=\sum_i\alpha_{i\to l}v_i$、$\alpha_{i\to l}=\mathrm{softmax}_i(w_l\cdot k_i)$ 逐步算出来($l=4$、前 3 层为例,数值示意):$w_l$ 是每层一个可学习的 pseudo-query ,与各层 $k_i$ 点积得分、softmax 成权重 α、再按 α 加权各 $v_i$ 得 $h_l$。
落地:Block 版本,drop-in 便宜替换
Full AttnRes
每层都 attend 所有前层,内存/通信开销 $O(Ld)$——上百层时太贵,工程上跑不起。
Block AttnRes(K3 采用)
把层分成 N 块:块内走标准残差,只在 N 个
块摘要 之间做注意力,降到 $O(Nd)$。可直接替换原结构。
(a) 标准残差等权累加 (b) Full AttnRes 每层 attend 所有前层 (c) Block AttnRes 只在块摘要间做注意力
Scaling law(arXiv:2603.15031 Fig.4):Block AttnRes loss 1.692 ≈ baseline 1.714 多花 1.25× 算力的效果。
③ Stable LatentMoE
≈1.08×
LatentMoE 结构红利 占 K3 综合 2.5× 的 约 8%
它从哪来: 把专家计算搬到低维 latent 空间,同一算力预算能塞下更多专家、挂更高 top-k,换来「每 FLOP 更准」。
口径:稀疏度 + 低维/路由稳定收益反推估算,非官方消融。
打个比方: K3 是一家有 896 个专科门诊 的超级医院,总参 2.8T 是这栋大楼的规模。但每个病人(token)进来只挂 16 个号 (Top-K=16)——楼盖得再大,单次问诊也只付 16 个专家的钱。总参数 ≠ 每 token 的计算量 ,这是它「养得起」的第一层原因。
核心技术:Stable LatentMoE(NVIDIA · arXiv:2601.18089)
普通 MoE 在完整隐藏维 $d_{model}$ 上又路由又算专家,专家一多就贵。LatentMoE 先把 token 压到更小的 latent 维 $\ell$ 再算、再投回:
$$d_{model}\;\to\;d_{latent}\;\to\;\text{Experts}\;\to\;d_{model}$$
按 $d/\ell$ 的比例,all-to-all 通信、每专家 FLOP、激活传输、专家权重带宽 四头一起降。省下的预算换成「更多专家 + 更高 top-k」。NVIDIA 在 iso-FLOP / iso-param 下验证到 95B 参数、1T token,每 FLOP 的准确率稳定优于标准 MoE 。K3 用的是 Stable 版,完整数学未公开。
token 先压到低维再路由,省下的算力换更多专家 → ≈1.08×
d_model → d_latent → Experts(top-k) → d_model
①
x
d_model=8
W_d
×(ℓ/d)
②
z=W_d·x
d_latent=3
route
③ top-k=16*
④ 选中专家在 latent 算
W_u
latent→d_model
⑤
y
d_model=8
按 d/ℓ 因子同时降:
all-to-all 通信
×(ℓ/d)
每专家 FLOP
×(ℓ/d)
激活传输
×(ℓ/d)
专家权重带宽
×(ℓ/d)
省下预算 → 更多专家 + 更高 top-k
标准 MoE:专家在 d_model 上算
E1
E2
E3
E4
每专家 FLOP ∝ d_model → 大算子,专家数受限
LatentMoE:专家在 d_latent 上算 + 多养专家
每专家 FLOP ∝ d_latent → 小算子,同预算专家数↑ top-k↑
iso-FLOP / iso-param 下 accuracy per FLOP 更优:省下的通信/带宽预算换更多专家与更高 top-k → ≈1.08×
(ℓ=d_latent,d=d_model,ℓ/d<1 是压缩比;arXiv:2601.18089,数值示意)
token 先降到低维 latent 再路由,专家在低维算,省下的通信/带宽换更多专家与更高 top-k。来源 arXiv:2601.18089。
latent 化 = 净赚
稀疏度从 K2 的 $384/8{=}48$ 提到 K3 的 $896/16{=}56$,$(56/48)^{0.3}\approx1.047$;叠加低维计算、路由稳定、通信收益,取净 ≈1.08× 。同样的钱,专家更多、命中更准。
别拿 50B 当激活量
$2.8T\times16/896\approx50B$ 只是「专家那部分」的粗算——还有注意力、共享层、公共投影都要计入。官方从未公开真实激活量 ,别把这个数当结论。
④ 896 选 16 为什么不崩:把纸面参数变成能用的参数
打个比方: 食堂开了 896 个窗口,每个学生只准去 16 个。结果全挤那几个网红窗口(过载 ),冷门师傅没人来、越干越生(死专家 ),队伍忽长忽短(动态 shape ),谁先打完得等最慢那队(空泡 )。K3 要做的,就是给它装一套智能调度。
极端稀疏 (896选16 ≈ 1.8%) 最怕负载失衡;五件套把它压平 → 保住理论容量
不均衡(会崩)
均衡(K3,固定 shape)
过载
过载
死
过载
死
热点专家过载 · 死专家 load≈0
每卡 token 数随机(动态 shape)
五件套调度
Quantile Balancing 等
削峰填谷 · 高度近似均匀
无 straggler · 固定 shape
不产生新智能,但保证 2.8T 参数不因训练不稳 / 死专家 / 通信瓶颈而白白损失。
同样一批 token,左边负载严重失衡(红=过载/死专家),右边经调度后各专家负载拉平——理论容量才真正用得上。
五个崩溃点 · 一套解法
崩溃点 对应机制 一句直觉
热门专家过载 Quantile Balancing 按 router 分数分位数分负载,削峰
死专家(冷门训练不足) Quantile Balancing 把富余流量填给冷门,人人有活干
动态 shape(每卡 token 数飘) 全平衡专家并行 固定 shape,显存不再按最坏情况留
路由需 Host 参与(CPU 卡顿) 全平衡专家并行 关键路径无 Host 同步,不等 CPU
All-to-All 空泡(等最慢卡) 全平衡专家并行 负载均匀 → 没有拖后腿的 straggler
前两件(Quantile Balancing + 全平衡专家并行)正面治这五个崩溃点;后三件——SiTU (控极稀疏激活稳定)、Gated MLA (注意力加门控)、Per-Head Muon (每个注意力头独立跑 Muon)——是保证 2.8T 长跑不发散的训练稳定配套。
⑥ 前端为什么特别强:它能"看见"自己写的页面
WebDev 暂列 #1
Arena 1679 · 领先 Fable5
关键结论: K3 的前端专项优势,来自它是原生多模态 ——能瞄一眼运行截图边看边改。这条"视觉—代码闭环"只在输出是给人看的界面 时才生效,所以 WebDev 领先、综合智能并非第一。
打个比方: 只会写代码、看不到屏幕的模型,像一个看不见显示器的前端工程师 ——语法一行不错,可页面挤成一坨、配色辣眼睛,它自己毫无察觉。K3 能瞄一眼截图,边看边调 padding、对齐和配色。
前端 = 写→ 跑→ 看→ 改 闭环,能否「看见」截图决定成败
传统 Coding 模型(无视觉)
视觉 Agent · K3(多模态)
1
写代码
2
运行
3
看截图
4
改
环断开
只优化「能不能跑」
可跑通
看不见
1
写代码
2
运行
3
看截图
4
发现问题·改
闭环
优化「好不好看」
多模态
看得见
布局/审美
WebDev Arena(前端竞技场)
1679 · 暂#1
综合 Intelligence(综合智力)
≈57 · 约#4
专项强 · 综合非第一
多模态让「看截图」这一步可执行,视觉闭环成立 = 前端专项强的直接来源。
传统模型在③断开,只能循环①②验证「能跑」;K3 闭合①→②→③→④,可迭代「好看」。
写→跑→看→改闭环:"看截图"这步是关键。看不见屏幕,环就断在这里。K2.5 已披露大规模视觉—文本联合训练与"看着截图调代码"的视觉调试。
传统 Coding:只优化"能不能跑"
编译过、单测过 = 任务完成。它没有截图这条反馈通道,看不到成品长什么样。
视觉 Agent:在能跑之上还优化"好不好看"
读一眼截图判断布局、留白、审美是否舒服,再回头改代码。这正是前端好坏的分水岭。
⑦ 高分里有多少是"推理预算"堆出来的
分数 = 能力打底 + 推理预算 + Harness 层层叠高
三个乘数,权重只是第一个
打个比方: 同一场考试,K3 用了近 2 倍的草稿纸 (更长思考)、被允许查资料 (工具调用)、手里还有好用的答题模板 (Agent Harness)。最后分高——一部分是真本事,一部分是别人没这待遇。要把这两块拆开看。
证据:一次评测烧掉多少 token
~130–132M
K3 单次评测输出 token(默认 max reasoning)
高分 = 能力 + 推理预算 + Harness 层层叠加,权重只是最底一层
benchmark 分数 S = 5 层堆叠
单次评测输出 token 量 T
模型本身能力(权重)
更长思考
更多工具调用
更长上下文
Agent Harness
← 这才是权重底子
推理
预算
+Harness
~131M
Kimi-K3
~63M
同类中位数
≈ 2×
✓ 正面:效率真的涨了
AA 显示 K3 比 K2.6 少用约 21% 输出 token ,Intelligence 反而升了 13 分 。单位 token 更高效。
✗ 反面:横向比要打折
官方测试混用 KimiCode / Claude Code / Codex 不同 Harness ,部分模型还 fallback。
蒸馏传闻与最终判断
① 蒸馏传闻:准确的表述是什么
有较强证据证明月之暗面曾大规模获取 Claude 输出,重点提取 Agent、编程、工具调用和视觉能力;美国官员进一步声称这些数据被用于 K3、且教师模型包括 Fable。但目前没有任何公开训练数据、技术审计或权重分析,能证明 K3 的多少能力来自蒸馏。
② 据称具体蒸馏了什么
Anthropic 披露最具体:称月之暗面通过数百个账号产生超过 340 万次 Claude 交互 ,集中在六类高价值数据。核心不是「最终答案」,而是 Agent 的行为策略 $\pi(a_t\mid s_t)$——在当前上下文、工具结果与任务状态下,下一步该采取什么动作。
类别 提取的核心
Agentic reasoning 拆解复杂任务、何时调工具、按结果改计划、失败重试恢复、连续执行几十到几百步。
工具调用与编排 工具选择、参数构造、多工具顺序、并行/串行调度、错误处理、结果汇总——完整轨迹比单条回复更值钱。
Coding 与数据分析 代码库理解、Bug 定位修复、Patch 生成、跑测试改报错、数据清洗可视化、长程软件工程。
Computer-use Agent 理解屏幕界面、决定点击/输入/滚动、按页面变化续行、跨应用完成工作流。
Computer Vision 截图理解、UI/网页视觉分析、图像信息提取、视觉反馈驱动改代码、可能含视频到代码。
Claude 推理轨迹 后期用更针对性的方式「重建 reasoning traces」:让 Claude 补写推理、解释动作、复盘失败,把隐式策略转成可监督文本,用于 Process SFT 或 RL 初始策略。
对应的训练数据可能形如:$\text{任务}\to\text{计划}\to\text{工具调用}\to\text{观察}\to\text{修正计划}\to\text{最终答案}$。
③ 这些数据可能怎么进入 K3(推断,非证实)
目前没有 K3 训练配方披露,以下是按行业通行方法推断的可能流水线,不是已证实事实 :
教师生成任务 :让 Claude/Fable 批量生成困难任务(复杂改码、多工具研究、浏览器操作、数据分析、视觉 Coding、长程 Agent)——先蒸馏的不是答案,而是「什么任务能训练出能力」。
教师生成成功轨迹 :教师在环境中完成任务,收集 Planning / Tool calls / Observations / 中间决策 / Error recovery / Patch-Test 循环 / Final answer,再用测试、编译器或环境反馈筛掉失败轨迹。
SFT 学习教师策略 :用成功轨迹训练 K3,$\mathcal L_{\text{SFT}}=-\sum_t\log\pi_\theta(a_t\mid s_t)$,学生主要学「怎么拆任务、用工具、写码验证、出错回退、组织长程任务」。
Rejection Sampling :同题生成多条 K3 轨迹,用规则/测试/教师择优 $y^*=\arg\max_{y_i}R(x,y_i)$,高质量轨迹回流训练。
教师充当 Judge / Reward Model :Pairwise 比较、按 Rubric 打分、判错因、给改进版、产生过程奖励。Anthropic 曾披露其他中国实验室用 Claude 当 RM,但无材料证明月之暗面在 K3 上具体采用了哪种 RM 流程——只能标为推测。
再做可验证 RL :继续用环境奖励 $R=R_{\text{test}}+R_{\text{tool}}+R_{\text{task}}+R_{\text{format}}$ 训练,目标从「模仿 Claude」变成「在环境里完成任务」,学生可在窄任务上超过教师。
④ 目前有哪些直接证据
证据 能说明什么 不能说明什么
Anthropic 检测到 >340 万次交互 月之暗面确实被指大规模提取 Claude 的 Agent、Coding、视觉能力 没直接说明哪些数据进入了 K3
请求元数据、IP 和账号网络 Anthropic 称能高置信度归因到月之暗面 原始取证数据没完整公开
后期尝试重建 Claude 推理轨迹 蒸馏不只最终答案,还涉及推理和 Agent 过程 不知道轨迹数量和训练权重
白宫官员称 Fable 用于 K3 把此前泛指「Kimi 模型」的指控具体落到 K3 官员尚未公开技术证据和审计结果
K3 偶尔自称 Claude 可能存在身份泄漏或 Claude 相关训练数据 单独无法证明蒸馏,更不能证明「套壳」
K3 与 Claude 行为相似 可作行为层面的旁证 相似也可能来自公开数据、相同 Harness 和共同训练范式
2026-07-22,白宫科技政策负责人 Michael Kratsios 表示,美方掌握的信息显示月之暗面蒸馏了 Anthropic Fable 用于开发 K3,并称其建立了可在多种访问方式间切换的内部平台。但美方目前未公开:提示词与输出样本、Fable 数据量、K3 数据混合比例、模型行为指纹报告、水印检测方法、独立第三方审计。它是一个严肃的政府指控,但还不是公开可复核的技术结论。
⑤「K3 自称 Claude」能否证明蒸馏
✓ 官方解释在技术上成立 月之暗面对 K2.5 的解释:预训练上采样了较新互联网编程数据,这些内容与「Claude」token 高度关联;缺正确 System Prompt 时模型身份本就未定义。公开编程数据里确实充斥 Claude Code 教程、Claude 生成的代码/README、「Generated with Claude」标记、系统提示词与对话、Anthropic API 代码。
✗ 真正的蒸馏实锤需要同时出现 高频身份泄漏、非公开模型标识符复现、特有措辞高度一致、相同的罕见错误、相同的拒答边界、相同的推理与工具调用轨迹、可统计复现的输出分布相似性。
所以「自称 Claude」是弱旁证,不是实锤。
⑥ 蒸馏能否解释 K3 的全部能力
不能。更合理的判断是:蒸馏若存在,主要提升 K3 的后训练策略与 Agent 行为;基座能力、架构、长上下文与训练稳定性,不可能仅靠 Claude 输出得到。 无法通过输出蒸馏直接复制的部分包括——
2.8T MoE 基座参数、Kimi Delta Attention、Attention Residuals、Stable LatentMoE;
Quantile Balancing、Per-Head Muon、Gated MLA、SiTU;
1M 上下文基础设施、大规模预训练形成的世界知识与底层表征。
这些来自模型架构、预训练数据、优化器、Scaling 和训练系统。月之暗面业务负责人也否认 K3 是对现有模型的蒸馏复刻,称性能提升主要来自底层架构创新。
⑦ 340 万次交互,多不多
相对预训练 token 不算大,相对高质量 Agent 后训练数据则非常大。设一次交互平均 5K~20K token:
$$3.4\text{M}\times(5\text{K}\sim20\text{K})=17\text{B}\sim68\text{B}\ \text{token}$$
这可能远小于 K3 的数十万亿级预训练数据,但这些 token 来自前沿教师、专门针对高价值能力、含长程推理与工具轨迹、可被环境验证、适合 SFT/RFT/RL Bootstrap ——占比很低,却对后训练能力有很高杠杆。
最终判断:一条工程主线
把前面所有拆解合起来看,K3 的强是一条清晰主线:先用架构三件套把 2.8T 容量「训得起、部署得起」,再把容量灌进 Agent 训练闭环,最后在推理阶段放大一档。 2.8T 只是容量基础,真正让它「特别能干活」的,是 Agent 数据与整套训练闭环,而非参数量本身。
① 架构三件套
② 2.8T 容量
③ Agent 训练闭环
④ 推理放大
KDA · 解序列
线性注意力压住长上下文开销
AttnRes · 解深度
残差让极深网络稳定训
Stable LatentMoE · 解宽度
2.8T 参数稳定摊开
2.8T
MoE 容量池
896 选 16 · 训得起 / 部署得起
必要条件,不是充分条件
执行任务
环境验证
SFT / RL
筛选轨迹
↻
max reasoning
Agent Harness
推理预算
① 架构三件套
KDA / AttnRes / Stable LatentMoE 让 2.8T「训得起、部署得起」——是必要条件 ,不是充分条件。
② 会干活的来源
让它「特别能干活」的是 Agent 数据闭环 + 环境验证 + 长轨迹 RL + 视觉-代码闭环 ,而非单纯参数规模。
③ 读数要打折
评测高分含高推理预算 成分,且多数结构数字是反推 / 第三方口径;官方消融未出前,对单一归因保持审慎。
图:K3 的工程主线——三件套撑起 2.8T 容量 → Agent 闭环把容量变成产能 → 推理阶段再放大。底层容量抄不来,真正的护城河是中间那个自我加速的训练闭环。