Kimi-K3 为什么这么强?
两件事同时做到极端

K3 不是“突然靠某个黑科技变强”,而是把 两件事同时做到极端
架构创新(KDA + AttnRes + Stable LatentMoE)让 2.8T 模型能被训练和部署;真正把它变成强 Coding/Agent 模型的,更多是 大规模数据、环境交互训练和推理预算
可扩展架构撑起巨大稀疏容量
KDA×AttnRes×LatentMoE → 2.8T MoE
序列、深度、宽度三个瓶颈各被一个模块解开,综合 ~2.5× scaling 效率—— 896 选 16 的 2.8T MoE
高推理时计算
输出 token ≈ 同类
默认最高推理档,Agent Harness 放大能力。

先看一个数字:训练效率 ≈2.5×

2.5×
整体 scaling 效率
(相对 K2,官方口径)
同一笔训练预算,K3 能学出 2.5 倍 的「有效能力」。
2.5× 从哪来 · 四个技术模块的贡献(按对数贡献占比)
KDA
长上下文注意力
≈1.83× · 占 66%§①
AttnRes
深度残差
≈1.20× · 20%§②
Stable LatentMoE
稀疏宽度
≈1.08× · 8%§③
训练与数据配方
Muon/课程/轨迹
≈1.053× · 6%§④⑤
对估值意味着什么
训练效率 2.5× ≈ 单位能力的训练成本降到约 1/2.5。同样的 GPU 预算,K3 能站上 2.8T 这个别人烧不起的规模,并把省下的钱转投到 Agent/Coding 的数据与 RL 上。
但必须诚实标注口径
「2.5×」是官方对外说法,尚无公开的逐模块消融;下面每一章给出的 1.83× / 1.20× / 1.08× / 1.053× 都是基于公开论文数据的反推与估算(会逐条标口径)。

① KDA:为什么它能把训练效率拉到 1.83×

KDA 的效率账
≈1.83×
占 2.5× 的 约 66%
1.68×(更便宜)× 1.09×(更聪明)≈ 1.83×。前者来自把长上下文成本从平方压成近线性、同算力多训 1.68× 数据;后者来自细粒度门带来的更高学习效率。
口径:基于公开论文数据的反推估算(假设了偏长的训练分布),非官方消融——数量级判断,完整推导见文末 §⑧。
1.16×
训练效率↑
−75%
1M 显存↓
6.3×
1M 解码↑
84.3
长文检索分
四个公开数字来自 Kimi Linear 受控对照(arXiv:2510.26692),验证 KDA 架构本身收益;K3 用同源架构,端到端数字官方未逐项公开。
打个比方:传统注意力像每读一个新词都把整本书从头翻一遍——上下文越长每步越慢,成本随长度平方($O(n^2)$)膨胀。KDA 换成随身带一个固定大小的笔记本,大多数时候只查笔记、偶尔翻回原书核对,于是上下文再长,每步成本几乎不变

给两种架构各写出「单 token 成本」公式,代入各档长度、按一个偏长的训练分布加权平均,两者一比就是 1.68×

全注意力(成本随长度线性涨)
$c_{\rm MLA}(n)=1+\dfrac{n}{40\text{K}}$
KDA(斜率砍到 0.35,几乎压平)
$c_{\rm KDA}(n)=1+0.35\cdot\dfrac{n}{40\text{K}}$
$n$ = 上下文长度
40K =「注意力开始主导」的临界长度
0.35 = KDA 只剩约 1/4 层保留平方复杂度的等效斜率系数
按预训练数据长度配比,加权计算两种注意力的单 token 成本
上下文长度占比(假设)全注意力成本KDA 成本
8K40%1.21.07
32K42%1.81.28
128K15%4.22.12
1M3%269.75
加权平均100%2.651.58
2.65 ÷ 1.58
1.68×
全注意力平均每 token 成本 2.65,KDA 只要 1.58——同样算力能多训 1.68× 的数据。这是效率账的第一层(算力账)。
Kimi Linear Fig1(b) TPOT vs 解码长度
全注意力(虚线)随长度爆炸式上升,Kimi Linear(实线)几乎压平——1M 上下文快 6.3×。这是推理速度;训练侧同理。
便宜的记忆表通常「记不准」。KDA 的核心技术是把遗忘做到每个通道单独可调:前代(Gated DeltaNet)用一个标量遗忘门,整表统一衰减;KDA 换成对角门 Diag(α)——每个 key 通道各有自己的遗忘率,正在写的函数签名几乎不忘、无关旧上下文快速淡出。这就是「便宜也能记得准」的来源,也是 KDA 收敛更快、长上下文更稳的核心。
一次 KDA 更新:记忆表怎么被改写(看格子变化即可,β=0.7 举例)
公式 St=(I−βkkᵀ)·Diag(α)·St-1+βkvᵀ 的三个算子,从右往左作用 St=(I − β k kᵀ)·Diag(α)·St-1+β k vᵀ矩阵从右往左作用:①先遗忘②再擦除③后写入 旧笔记 St-1(当前状态)① 细粒度遗忘每行按自己的 α 变淡② 按 β 比例擦除k 那行 ×(1−β) 削弱,非清零③ 写入新值 = St残留 (1−β)旧 + β新,插值 k k k k 已存旧关联(蓝) 本步新写入(绿) 当前 key k 指向的行
图:每来一个 token,记忆表就走三步——① 每行按自己的率遗忘(这就是「细粒度对角门」的直观样子)→ ② 把当前 key 那行按 β 比例削弱(残留 (1−β) 倍,不是清零)→ ③ 写入新值,该行成为「旧值 + 新值」的插值。全注意力要存下每个 token,KDA 只把这张固定大小的表原地改写一次。

② AttnRes:让网络叠得更深还不糊 → 1.20×

≈1.20×
等效算力增益
约占 K3 总提升的 20%
打个比方:等权残差像一场不断加人的大会,每个新发言者都要把前面所有人的话等音量重播一遍——开到 100 层谁都听不清;AttnRes 给每层配个主持人,把有用的几层调大、没用的调小。
口径:论文 scaling law 实测 gross 1.25×,与 KDA 部分重叠,保守折算净 1.20×。

标准残差每层固定加一个单位权重:$h_l = h_{l-1} + f_l(\cdot)$,幅度随层数 $O(L)$ 无控增长,PreNorm 只能靠归一化稀释早层。佐证:很深的模型剪掉不少中间层往往掉点不明显——说明大量层其实"糊在一起"是冗余。

让每层对前面所有层做一次 softmax attention,自己决定听谁:

$$h_l = \sum_{i<l}\alpha_{i\to l}\,v_i,\qquad \alpha_{i\to l} = \mathrm{softmax}_i\!\left(w_l\cdot k_i\right)$$

$w_l$ 是每层一个可学习的 pseudo-query(伪查询)——额外开销仅此一项,几乎不加参数,却把"被动等权继承"变成"主动按需检索历史"。

h4 = Σ i αi→4 vi , αi→4 = softmax( w4 · ki ) ① 每层的 k, v ② w₄·kᵢ 点积得分 ③ softmax→αᵢ ④ Σαᵢvᵢ=h₄ w4 第4层pseudo-queryk1 v1 第1层w4 · k1= 1.27softmax0.47×v1k2 v2 第2层w4 · k2= 0.70softmax0.15×v2k3 v3 第3层w4 · k3= 1.16softmax0.38×v3α1v1α2v2α3v3h4 同一个 pseudo-query w₄ 分别与每层 kᵢ 点积 → 得分 → softmax 成 α → 按 α 加权叠成 h₄ w₄ 是第4层唯一可学习的向量(pseudo-query),它决定「听哪层」;标准残差没有它,只能 α=1/L 等权
把公式 $h_l=\sum_i\alpha_{i\to l}v_i$、$\alpha_{i\to l}=\mathrm{softmax}_i(w_l\cdot k_i)$ 逐步算出来($l=4$、前 3 层为例,数值示意):$w_l$ 是每层一个可学习的 pseudo-query,与各层 $k_i$ 点积得分、softmax 成权重 α、再按 α 加权各 $v_i$ 得 $h_l$。
每层都 attend 所有前层,内存/通信开销 $O(Ld)$——上百层时太贵,工程上跑不起。
把层分成 N 块:块内走标准残差,只在 N 个块摘要之间做注意力,降到 $O(Nd)$。可直接替换原结构。
AttnRes 架构:标准残差 / Full / Block
(a) 标准残差等权累加 (b) Full AttnRes 每层 attend 所有前层 (c) Block AttnRes 只在块摘要间做注意力
AttnRes scaling law 曲线
Scaling law(arXiv:2603.15031 Fig.4):Block AttnRes loss 1.692 ≈ baseline 1.714 多花 1.25× 算力的效果。

③ Stable LatentMoE

≈1.08×
LatentMoE 结构红利
占 K3 综合 2.5× 的 约 8%
它从哪来:把专家计算搬到低维 latent 空间,同一算力预算能塞下更多专家、挂更高 top-k,换来「每 FLOP 更准」。
口径:稀疏度 + 低维/路由稳定收益反推估算,非官方消融。

打个比方:K3 是一家有 896 个专科门诊的超级医院,总参 2.8T 是这栋大楼的规模。但每个病人(token)进来只挂 16 个号(Top-K=16)——楼盖得再大,单次问诊也只付 16 个专家的钱。总参数 ≠ 每 token 的计算量,这是它「养得起」的第一层原因。

普通 MoE 在完整隐藏维 $d_{model}$ 上又路由又算专家,专家一多就贵。LatentMoE 先把 token 压到更小的 latent 维 $\ell$ 再算、再投回:

$$d_{model}\;\to\;d_{latent}\;\to\;\text{Experts}\;\to\;d_{model}$$

按 $d/\ell$ 的比例,all-to-all 通信、每专家 FLOP、激活传输、专家权重带宽四头一起降。省下的预算换成「更多专家 + 更高 top-k」。NVIDIA 在 iso-FLOP / iso-param 下验证到 95B 参数、1T token,每 FLOP 的准确率稳定优于标准 MoE。K3 用的是 Stable 版,完整数学未公开。

token 先压到低维再路由,省下的算力换更多专家 → ≈1.08× d_modeld_latentExperts(top-k)d_model x d_model=8 W_d ×(ℓ/d) z=W_d·x d_latent=3 route ③ top-k=16* ④ 选中专家在 latent 算 W_u latent→d_model y d_model=8 按 d/ℓ 因子同时降: all-to-all 通信 ×(ℓ/d) 每专家 FLOP ×(ℓ/d) 激活传输 ×(ℓ/d) 专家权重带宽 ×(ℓ/d) 省下预算 → 更多专家 + 更高 top-k 标准 MoE:专家在 d_model 上算 E1 E2 E3 E4 每专家 FLOP ∝ d_model → 大算子,专家数受限 LatentMoE:专家在 d_latent 上算 + 多养专家 每专家 FLOP ∝ d_latent → 小算子,同预算专家数↑ top-k↑ iso-FLOP / iso-param 下 accuracy per FLOP 更优:省下的通信/带宽预算换更多专家与更高 top-k → ≈1.08× (ℓ=d_latent,d=d_model,ℓ/d<1 是压缩比;arXiv:2601.18089,数值示意)
token 先降到低维 latent 再路由,专家在低维算,省下的通信/带宽换更多专家与更高 top-k。来源 arXiv:2601.18089。
latent 化 = 净赚
稀疏度从 K2 的 $384/8{=}48$ 提到 K3 的 $896/16{=}56$,$(56/48)^{0.3}\approx1.047$;叠加低维计算、路由稳定、通信收益,取净 ≈1.08×。同样的钱,专家更多、命中更准。
别拿 50B 当激活量
$2.8T\times16/896\approx50B$ 只是「专家那部分」的粗算——还有注意力、共享层、公共投影都要计入。官方从未公开真实激活量,别把这个数当结论。

④ 896 选 16 为什么不崩:把纸面参数变成能用的参数

打个比方:食堂开了 896 个窗口,每个学生只准去 16 个。结果全挤那几个网红窗口(过载),冷门师傅没人来、越干越生(死专家),队伍忽长忽短(动态 shape),谁先打完得等最慢那队(空泡)。K3 要做的,就是给它装一套智能调度。

极端稀疏 (896选16 1.8%) 最怕负载失衡;五件套把它压平 → 保住理论容量 不均衡(会崩) 均衡(K3,固定 shape) 过载 过载 过载 热点专家过载 · 死专家 load≈0 每卡 token 数随机(动态 shape) 五件套调度 Quantile Balancing 等 削峰填谷 · 高度近似均匀 无 straggler · 固定 shape 不产生新智能,但保证 2.8T 参数不因训练不稳 / 死专家 / 通信瓶颈而白白损失。
同样一批 token,左边负载严重失衡(红=过载/死专家),右边经调度后各专家负载拉平——理论容量才真正用得上。
崩溃点对应机制一句直觉
热门专家过载Quantile Balancing按 router 分数分位数分负载,削峰
死专家(冷门训练不足)Quantile Balancing把富余流量填给冷门,人人有活干
动态 shape(每卡 token 数飘)全平衡专家并行固定 shape,显存不再按最坏情况留
路由需 Host 参与(CPU 卡顿)全平衡专家并行关键路径无 Host 同步,不等 CPU
All-to-All 空泡(等最慢卡)全平衡专家并行负载均匀 → 没有拖后腿的 straggler

前两件(Quantile Balancing + 全平衡专家并行)正面治这五个崩溃点;后三件——SiTU(控极稀疏激活稳定)、Gated MLA(注意力加门控)、Per-Head Muon(每个注意力头独立跑 Muon)——是保证 2.8T 长跑不发散的训练稳定配套。

⑥ 前端为什么特别强:它能"看见"自己写的页面

WebDev
暂列 #1
Arena 1679 · 领先 Fable5
关键结论:K3 的前端专项优势,来自它是原生多模态——能瞄一眼运行截图边看边改。这条"视觉—代码闭环"只在输出是给人看的界面时才生效,所以 WebDev 领先、综合智能并非第一。

打个比方:只会写代码、看不到屏幕的模型,像一个看不见显示器的前端工程师——语法一行不错,可页面挤成一坨、配色辣眼睛,它自己毫无察觉。K3 能瞄一眼截图,边看边调 padding、对齐和配色。

前端 = 写改 闭环,能否「看见」截图决定成败 传统 Coding 模型(无视觉) 视觉 Agent · K3(多模态) 1 写代码 2 运行 3 看截图 4 环断开 只优化「能不能跑」 可跑通 看不见 1 写代码 2 运行 3 看截图 4 发现问题·改 闭环 优化「好不好看」 多模态 看得见 布局/审美 WebDev Arena(前端竞技场) 1679 · 暂#1 综合 Intelligence(综合智力) ≈57 · 约#4 专项强 · 综合非第一 多模态让「看截图」这一步可执行,视觉闭环成立 = 前端专项强的直接来源。 传统模型在③断开,只能循环①②验证「能跑」;K3 闭合①→②→③→④,可迭代「好看」。
写→跑→看→改闭环:"看截图"这步是关键。看不见屏幕,环就断在这里。K2.5 已披露大规模视觉—文本联合训练与"看着截图调代码"的视觉调试。
传统 Coding:只优化"能不能跑"

编译过、单测过 = 任务完成。它没有截图这条反馈通道,看不到成品长什么样。

视觉 Agent:在能跑之上还优化"好不好看"

读一眼截图判断布局、留白、审美是否舒服,再回头改代码。这正是前端好坏的分水岭。

⑦ 高分里有多少是"推理预算"堆出来的

分数 = 能力打底 + 推理预算 + Harness 层层叠高
三个乘数,权重只是第一个
打个比方:同一场考试,K3 用了近 2 倍的草稿纸(更长思考)、被允许查资料(工具调用)、手里还有好用的答题模板(Agent Harness)。最后分高——一部分是真本事,一部分是别人没这待遇。要把这两块拆开看。
~130–132M
K3 单次评测输出 token(默认 max reasoning)
~63M
同类模型中位数输出 token
≈2×
K3 的"草稿纸"用量(AA 统计)
高分 = 能力 + 推理预算 + Harness 层层叠加,权重只是最底一层 benchmark 分数 S = 5 层堆叠 单次评测输出 token 量 T 模型本身能力(权重) 更长思考 更多工具调用 更长上下文 Agent Harness ← 这才是权重底子 推理 预算 +Harness ~131M Kimi-K3 ~63M 同类中位数 ≈ 2×
✓ 正面:效率真的涨了
AA 显示 K3 比 K2.6 少用约 21% 输出 token,Intelligence 反而升了 13 分。单位 token 更高效。
✗ 反面:横向比要打折
官方测试混用 KimiCode / Claude Code / Codex 不同 Harness,部分模型还 fallback。

蒸馏传闻与最终判断

有较强证据证明月之暗面曾大规模获取 Claude 输出,重点提取 Agent、编程、工具调用和视觉能力;美国官员进一步声称这些数据被用于 K3、且教师模型包括 Fable。但目前没有任何公开训练数据、技术审计或权重分析,能证明 K3 的多少能力来自蒸馏。

Anthropic 披露最具体:称月之暗面通过数百个账号产生超过 340 万次 Claude 交互,集中在六类高价值数据。核心不是「最终答案」,而是 Agent 的行为策略 $\pi(a_t\mid s_t)$——在当前上下文、工具结果与任务状态下,下一步该采取什么动作。

类别提取的核心
Agentic reasoning拆解复杂任务、何时调工具、按结果改计划、失败重试恢复、连续执行几十到几百步。
工具调用与编排工具选择、参数构造、多工具顺序、并行/串行调度、错误处理、结果汇总——完整轨迹比单条回复更值钱。
Coding 与数据分析代码库理解、Bug 定位修复、Patch 生成、跑测试改报错、数据清洗可视化、长程软件工程。
Computer-use Agent理解屏幕界面、决定点击/输入/滚动、按页面变化续行、跨应用完成工作流。
Computer Vision截图理解、UI/网页视觉分析、图像信息提取、视觉反馈驱动改代码、可能含视频到代码。
Claude 推理轨迹后期用更针对性的方式「重建 reasoning traces」:让 Claude 补写推理、解释动作、复盘失败,把隐式策略转成可监督文本,用于 Process SFT 或 RL 初始策略。

对应的训练数据可能形如:$\text{任务}\to\text{计划}\to\text{工具调用}\to\text{观察}\to\text{修正计划}\to\text{最终答案}$。

目前没有 K3 训练配方披露,以下是按行业通行方法推断的可能流水线,不是已证实事实

  1. 教师生成任务:让 Claude/Fable 批量生成困难任务(复杂改码、多工具研究、浏览器操作、数据分析、视觉 Coding、长程 Agent)——先蒸馏的不是答案,而是「什么任务能训练出能力」。
  2. 教师生成成功轨迹:教师在环境中完成任务,收集 Planning / Tool calls / Observations / 中间决策 / Error recovery / Patch-Test 循环 / Final answer,再用测试、编译器或环境反馈筛掉失败轨迹。
  3. SFT 学习教师策略:用成功轨迹训练 K3,$\mathcal L_{\text{SFT}}=-\sum_t\log\pi_\theta(a_t\mid s_t)$,学生主要学「怎么拆任务、用工具、写码验证、出错回退、组织长程任务」。
  4. Rejection Sampling:同题生成多条 K3 轨迹,用规则/测试/教师择优 $y^*=\arg\max_{y_i}R(x,y_i)$,高质量轨迹回流训练。
  5. 教师充当 Judge / Reward Model:Pairwise 比较、按 Rubric 打分、判错因、给改进版、产生过程奖励。Anthropic 曾披露其他中国实验室用 Claude 当 RM,但无材料证明月之暗面在 K3 上具体采用了哪种 RM 流程——只能标为推测。
  6. 再做可验证 RL:继续用环境奖励 $R=R_{\text{test}}+R_{\text{tool}}+R_{\text{task}}+R_{\text{format}}$ 训练,目标从「模仿 Claude」变成「在环境里完成任务」,学生可在窄任务上超过教师。
证据能说明什么不能说明什么
Anthropic 检测到 >340 万次交互月之暗面确实被指大规模提取 Claude 的 Agent、Coding、视觉能力没直接说明哪些数据进入了 K3
请求元数据、IP 和账号网络Anthropic 称能高置信度归因到月之暗面原始取证数据没完整公开
后期尝试重建 Claude 推理轨迹蒸馏不只最终答案,还涉及推理和 Agent 过程不知道轨迹数量和训练权重
白宫官员称 Fable 用于 K3把此前泛指「Kimi 模型」的指控具体落到 K3官员尚未公开技术证据和审计结果
K3 偶尔自称 Claude可能存在身份泄漏或 Claude 相关训练数据单独无法证明蒸馏,更不能证明「套壳」
K3 与 Claude 行为相似可作行为层面的旁证相似也可能来自公开数据、相同 Harness 和共同训练范式

2026-07-22,白宫科技政策负责人 Michael Kratsios 表示,美方掌握的信息显示月之暗面蒸馏了 Anthropic Fable 用于开发 K3,并称其建立了可在多种访问方式间切换的内部平台。但美方目前未公开:提示词与输出样本、Fable 数据量、K3 数据混合比例、模型行为指纹报告、水印检测方法、独立第三方审计。它是一个严肃的政府指控,但还不是公开可复核的技术结论。

✓ 官方解释在技术上成立
月之暗面对 K2.5 的解释:预训练上采样了较新互联网编程数据,这些内容与「Claude」token 高度关联;缺正确 System Prompt 时模型身份本就未定义。公开编程数据里确实充斥 Claude Code 教程、Claude 生成的代码/README、「Generated with Claude」标记、系统提示词与对话、Anthropic API 代码。
✗ 真正的蒸馏实锤需要同时出现
高频身份泄漏、非公开模型标识符复现、特有措辞高度一致、相同的罕见错误、相同的拒答边界、相同的推理与工具调用轨迹、可统计复现的输出分布相似性。
所以「自称 Claude」是弱旁证,不是实锤。

不能。更合理的判断是:蒸馏若存在,主要提升 K3 的后训练策略与 Agent 行为;基座能力、架构、长上下文与训练稳定性,不可能仅靠 Claude 输出得到。无法通过输出蒸馏直接复制的部分包括——

  1. 2.8T MoE 基座参数、Kimi Delta Attention、Attention Residuals、Stable LatentMoE;
  2. Quantile Balancing、Per-Head Muon、Gated MLA、SiTU;
  3. 1M 上下文基础设施、大规模预训练形成的世界知识与底层表征。

这些来自模型架构、预训练数据、优化器、Scaling 和训练系统。月之暗面业务负责人也否认 K3 是对现有模型的蒸馏复刻,称性能提升主要来自底层架构创新。

相对预训练 token 不算大,相对高质量 Agent 后训练数据则非常大。设一次交互平均 5K~20K token:

$$3.4\text{M}\times(5\text{K}\sim20\text{K})=17\text{B}\sim68\text{B}\ \text{token}$$

这可能远小于 K3 的数十万亿级预训练数据,但这些 token 来自前沿教师、专门针对高价值能力、含长程推理与工具轨迹、可被环境验证、适合 SFT/RFT/RL Bootstrap——占比很低,却对后训练能力有很高杠杆。

最终判断:一条工程主线

把前面所有拆解合起来看,K3 的强是一条清晰主线:先用架构三件套把 2.8T 容量「训得起、部署得起」,再把容量灌进 Agent 训练闭环,最后在推理阶段放大一档。2.8T 只是容量基础,真正让它「特别能干活」的,是 Agent 数据与整套训练闭环,而非参数量本身。

① 架构三件套 ② 2.8T 容量 ③ Agent 训练闭环 ④ 推理放大 KDA · 解序列 线性注意力压住长上下文开销 AttnRes · 解深度 残差让极深网络稳定训 Stable LatentMoE · 解宽度 2.8T 参数稳定摊开 2.8T MoE 容量池 896 选 16 · 训得起 / 部署得起 必要条件,不是充分条件 执行任务 环境验证 SFT / RL 筛选轨迹 max reasoning Agent Harness 推理预算 ① 架构三件套
KDA / AttnRes / Stable LatentMoE 让 2.8T「训得起、部署得起」——是必要条件,不是充分条件。
② 会干活的来源
让它「特别能干活」的是 Agent 数据闭环 + 环境验证 + 长轨迹 RL + 视觉-代码闭环,而非单纯参数规模。
③ 读数要打折
评测高分含高推理预算成分,且多数结构数字是反推 / 第三方口径;官方消融未出前,对单一归因保持审慎。
图:K3 的工程主线——三件套撑起 2.8T 容量 → Agent 闭环把容量变成产能 → 推理阶段再放大。底层容量抄不来,真正的护城河是中间那个自我加速的训练闭环。
Source · Kimi K3 博客 · Kimi Linear (2510.26692) · Attention Residuals (2603.15031) · LatentMoE (2601.18089)
注:本文含大量“反推/估算”,凡非官方数字均已标注口径。截至 2026-07-21,K3 权重与完整技术报告尚未发布。