本页目录 NCP-ArchPreview

NCP-ArchPreview

深入解析 NCP-ArchPreview 如何在标准自回归语言模型中联合训练下一词元与下一概念预测,并以乘积量化、概念模块和分层残差提升万亿词元预训练效率;结合匹配基线、领域适配和推测解码实验,审视其收益、成本与证据边界。

自动研究时间:2026-09-12 09:04(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 11,列表最顶部为 NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv v1 全文 PDF、完整 TeX 源码与附录 -> 官方模型集合。

执行摘要

标准大语言模型用 Next Token Prediction(NTP)学习“给定前文,下一个 token 是什么”。这个目标密集、稳定、易于扩展,却只在表层 token 上直接监督模型;跨越多个 token 的语义结构即使出现在隐藏状态里,也只是训练的副产品。NCP-ArchPreview 的核心主张是:保留 NTP 和普通逐 token 生成接口,同时显式要求模型预测下一个多 token 概念。

模型把 OLMo-3-7B 的 32 个 token 层拆成 16 层 Token Encoder 和 16 层 Token Decoder,中间插入 8 层 Concept Module。Encoder 每四个 token 的隐藏状态做均值池化,得到长度缩短为四分之一的连续概念序列;再将每个 4,096 维概念切成 32 段,每段在 128 个码字中量化。Concept Module 不直接输出一个硬离散编号,而是预测各段码本上的概率分布,以码字加权和形成可微的下一概念表示。该表示重复到 token 分辨率、整体因果移位一个 chunk 后注入 Decoder,从而在不偷看目标 token 的前提下提供较高层的预测信号。

这不是用“概念 token”替换文本 token。训练仍以 NTP 为主,并联合 Next Concept Prediction(NCP)和 Vector Quantization(VQ)损失;推理的外部契约仍是标准自回归语言模型。架构额外引入 Intra-Module Residual Connections(IRC)和 Cross-Module Residual Connections(CRC),动态复用同一模块的不同深度,并在 Encoder、Concept Module、Decoder 之间传递对齐后的中间状态。

作者将模型扩展到 8.94B 参数、5.73T Dolma-3 token。在 Stage-1,同数据训练下,它使用 OLMo-3-7B 的 51.3% token 就达到对方最终训练损失,相当于按 token 数计算的 1.95 倍收敛速度;最终损失低 0.091,26 项高分优先指标的宏平均从 46.59 提高到 49.04,提升 2.45 分,其中 GSM8K 提高 5.99 分。Stage-2 的优势缩小为平均 +0.59,代码类别反而下降 0.65 分,说明更低的总体训练损失并不自动转化为所有下游能力同步增强。

论文用参数匹配、计算匹配和渐进组件消融证明收益不只是“多加了八层”。Concept Module 在四分之一序列长度上工作,因此全模型约有 40 个标准 block 的参数量,却只有约 34 个 block 的解析计算量;完整模型用参数匹配 40 层基线 85% 的解析 FLOPs 接近其损失。独立 scaling ladder 则给出相对 OLMo-3 的 1.74 倍 compute-optimal 效率。不过这些主要是解析 FLOPs 和 loss 曲线,论文没有给出 5.73T 训练的端到端墙钟时间、通信开销或每 token 吞吐;层间状态物化、内存流量和小 kernel 调度也未包含在主要 FLOPs 口径中。

概念空间还被用于两个训练后场景。只更新已有的 17M VQ 码本与概念预测头,可以用比同参数 LoRA 更高的吞吐、更低的显存做代码、数学和知识适配;把上一完整 chunk 的概念状态注入 DFlash2 风格的 block-parallel drafter,则把四项任务的 Mean Accepted Length(MAL)从 5.933 提高到 6.180,平均相对增益 4.17%。这些结果说明潜空间可以成为可复用接口,但尚不能证明最终服务延迟同比下降,也不能把有限领域上的适配收益外推为通用知识编辑能力。

1. 论文基本信息

项目内容
论文标题NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
模型名称NCP-ArchPreview
论文编号arXiv:2609.10715
当前版本v1,2026-09-09 提交
作者The Intern-NCP Team:Jiaqi Cao、Chiyu Chen、Shuang Cheng、Xu Cheng、Beiya Dai、Yufan Feng、Kewen Ge、Ruijun Ge、Jiayi Huang、Yang Jiao、Dahua Lin、Zhouhan Lin、Yifan Liu、Yuliang Liu、Biqing Qi、Mowen Ruan、Junzhe Shen、Yunchong Song、Hao Sun、Zhongbo Tian、Yixuan Wang、Rubin Wei、Jiaxin Xiong、Kangyu Yang、Qian Yao、Qi Zhang、Bowen Zhou
机构Shanghai AI Lab;LUMIA Lab,Shanghai Jiao Tong University
基础架构OLMo-3-7B
规模8.94B 参数;5.73T 预训练 token;最大训练长度 8,192
训练数据Stage-1:Dolma 3 Mix;Stage-2:Dolma 3 Dolmino
核心机制NTP + NCP + VQ;Concept Module;IRC + CRC
开放内容Stage-1/Stage-2 权重、中间 checkpoint、drafter、推理脚本、训练 recipe 与评测代码

核心链接:

2. 背景与动机:token 是输出接口,不必是唯一学习尺度

2.1 NTP 的成功与粒度限制

标准因果语言模型优化:

LNTP=1T1t=1T1logp(xt+1xt).\mathcal L_{\mathrm{NTP}} =-\frac{1}{T-1}\sum_{t=1}^{T-1} \log p(x_{t+1}\mid x_{\le t}).

它的优势是每个位置都有监督,训练和采样接口统一,扩展到万亿 token 已有成熟工程路径。但 token 通常只是词的一部分、标点或短词。模型要回答数学题、写程序或维持段落主题,内部必须形成跨 token 的对象、关系和计划;NTP 并未直接规定这些中间抽象应该是什么,更没有要求模型预测它们怎样演进。

视觉生成已经展示了在压缩 latent 中建模的效率,JEPA 路线也强调预测表示而非还原每个细节。语言领域的难点在于:latent 既要承载多 token 语义,又不能破坏标准 token 生成,更不能让训练时的未来信息泄漏到当前预测。

2.2 既有路线解决了问题的一部分

路线代表工作与 NCP-ArchPreview 的区别
固定层级/patchHourglass Transformer、MegaByte、ContextLM压缩序列或改变计算粒度,但未必学习离散概念预测目标
动态 chunkBLT、H-Net、DLCM根据输入选择边界或 patch 大小;NCP-ArchPreview 固定每四 token 聚合
句子级连续概念Large Concept Model在外部或共享连续句向量空间预测;本文从自身隐藏状态学习码本
多 token 预测MTP辅助头仍预测多个表层 token;NCP 预测一个压缩的 latent span 表示
连续 latent reasoninglatent thought、continuous concept 方法依赖连续状态;本文用 product quantization 约束目标空间
离散概念预测ConceptLMNCP 的直接前作,验证到从头训练 1.5B 和继续预训练 8B;本文从一开始在 8.9B、5.73T token 规模训练

因此,本工作的主要科学增量并不是第一次提出 NCP,而是把这一目标嵌入可从头扩展的 foundation-model 架构,并在参数、计算、数据和训练阶段控制下验证其规模化表现。

3. 核心贡献

3.1 同时预测 token 和离散概念

NCP-ArchPreview 保留 token 级主干,把高层预测作为并行目标和反馈信号。概念由模型自己的 Encoder 隐藏状态形成,无需外部句子编码器或人工语义标签;离散码本让预测被限制在学习到的概念原型组合附近,而不是在任意连续向量中自由回归。

这种设计试图兼顾三点:

  1. 外部兼容:输入输出仍是普通 token,可复用自回归训练、评测与部署接口;
  2. 更长监督跨度:每个概念总结四个 token,要求模型显式预测下一段隐藏结构;
  3. 内部可复用性:码本和概念状态可以继续服务领域适配与并行 drafter。

3.2 在短序列上增加模型容量

8 层 Concept Module 的参数量近似 8 个标准 Transformer block,但输入长度只有 token 流的四分之一。作者的近似口径是:一个概念层拥有约一个 token 层的参数,却使用不到四分之一的解析训练 FLOPs。这使模型能以较小计算增量增加深度与表达能力。

需要谨慎区分“参数效率”和“运行效率”。Concept Module 降低了主矩阵运算量,但 IRC/CRC 仍要保存、归一化、选择和搬运多层状态。论文自己承认解析 FLOPs 未计入状态物化、内存访问、归约和小 kernel launch,因此真实硬件收益必须由端到端 profiling 验证。

3.3 分层残差让跨深度、跨尺度信息可选择地流动

普通 Transformer 的残差把上一层状态固定相加。IRC 让每层根据当前状态,为同一模块内从输入到当前深度的候选状态生成未归一化、可带符号的混合系数;初始化时只选择最近状态,所以训练起点接近标准残差。

CRC 则在三个模块之间建立:

  • Token Encoder -> Concept Module;
  • Token Encoder -> Token Decoder;
  • Concept Module -> Token Decoder。

源模块多个深度的状态先经 LayerNorm,再由目标状态生成的 softmax 权重混合,最后通过学习到的逐维缩放注入目标流。跨 token/概念分辨率时使用 chunk pooling 或重复与因果移位。这样,概念层不只读取 Encoder 最后一层,Decoder 也不只接收一个最终概念向量。

3.4 把概念空间变成训练后的轻量接口

论文不把 VQ 码本视为一次性辅助损失。冻结 8.9B token 主干,只更新 17M 码本和预测头,即可做领域适配;同一概念状态还可为推测解码的 drafter 提供跨多个未来位置的上下文。这两项实验共同支持一个更长远的设计观点:基础模型内部若有明确的潜空间接口,后续能力不一定都要通过全参微调或额外大模块注入。

4. 方法详解

4.1 三段式主干

模块配置作用
Token Encoder16 个 causal Transformer 层产生 token 隐藏状态,也是概念构造来源
Concept Module8 个 causal Transformer 层在压缩序列上预测下一概念
Token Decoder16 个 causal Transformer 层融合 token 与因果可用概念,输出下一 token

其他关键配置包括 hidden size 4,096、FFN size 11,008、32 个 attention head、词表 100,278、RoPE base 500,000、token 局部注意力窗口 4,096,并每四层使用一次 full attention。参数为 BF16,主实验最大训练长度 8,192。

4.2 从四个 token 得到一个连续概念

Token Encoder 将输入映射为 h1:T\mathbf h_{1:T}。压缩因子 k=4k=4,第 mm 个概念是连续四个隐藏状态的均值:

cm=1ki=1kh(m1)k+i,M=Tk.\mathbf c_m=\frac{1}{k}\sum_{i=1}^{k} \mathbf h_{(m-1)k+i},\qquad M=\left\lfloor\frac{T}{k}\right\rfloor.

因此 Concept Module 的序列长度约为 T/4T/4。这里“concept”是训练得到的潜表示,不是经人工标注的词义、实体或命题;四 token 的固定窗口也不保证与自然语言语义边界一致。这个名称表达其预期功能,而不是已被可解释性实验严格证明的本体类别。

4.3 乘积量化构造组合式概念词表

每个 4,096 维概念切成 S=32S=32 个 128 维片段;每段各有 N=128N=128 个码字,并选择最近的码字:

nms=argminncmsens22.n_m^s=\arg\min_n\left\|\mathbf c_m^s-\mathbf e_n^s\right\|_2^2.

单段码本很小,但 32 段组合理论上形成 12832128^{32} 种可能代码。VQ 损失只把选中的码字拉向停止梯度后的连续概念:

LVQ=1MSm,ssg(cms)dms22.\mathcal L_{\mathrm{VQ}}= \frac{1}{MS}\sum_{m,s} \left\|\operatorname{sg}(\mathbf c_m^s)-\mathbf d_m^s\right\|_2^2.

由于对 c\mathbf c 做 stop-gradient,VQ 拟合本身不会直接改写 Token Encoder;它让码本跟踪隐藏状态分布。

4.4 下一概念预测保持可微

Concept Module 读取此前连续概念 c<m\mathbf c_{<m},对每个片段输出 128 个码字的概率。模型不用 argmax 选一个码字,而计算期望:

c^ms=n=1Nπm,nsens,c^m=concats(c^ms).\hat{\mathbf c}_m^s=\sum_{n=1}^{N}\pi_{m,n}^s\mathbf e_n^s, \qquad \hat{\mathbf c}_m=\operatorname{concat}_s(\hat{\mathbf c}_m^s).

NCP 损失让预测概念逼近停止梯度后的下一连续概念:

LNCP=1M1m=2Mc^msg(cm)22.\mathcal L_{\mathrm{NCP}}= \frac{1}{M-1}\sum_{m=2}^{M} \left\|\hat{\mathbf c}_m- \operatorname{sg}(\mathbf c_m)\right\|_2^2.

预测目标不向 Encoder 反传,但 Concept Module 的历史输入没有 detach,因此 Encoder 会通过“怎样编码过去,才能更好预测未来概念”收到 NCP 梯度。这一细节避免目标与表示共同无约束漂移,同时仍允许辅助任务塑造上游表示。

4.5 因果移位防止训练泄漏

若把由第 mm 个 token chunk 算出的概念直接送回同一 chunk,Decoder 会间接看到目标 token。作者先把预测概念重复四次恢复 token 分辨率,再整体移位 Δ=k\Delta=k;前缀用零填充。随后与 Encoder 状态相加:

h~t=ht+bt.\widetilde{\mathbf h}_t=\mathbf h_t+\mathbf b_t.

Concept Module -> Decoder 的 CRC 也使用同样移位。于是当前 token 只能利用由已经处理完成的更早 chunk 产生的概念信号,NTP 仍是合法的因果目标。

4.6 三个损失端到端联合优化

总目标为:

Ltotal=LNTP+αLNCP+βLVQ.\mathcal L_{\mathrm{total}}= \mathcal L_{\mathrm{NTP}}+ \alpha\mathcal L_{\mathrm{NCP}}+ \beta\mathcal L_{\mathrm{VQ}}.

NTP 为全部路径提供密集监督;NCP 训练概念预测并塑造历史概念表示;VQ 让码本适配概念分布。矩阵参数使用 Moonlight Muon,embedding、bias 等参数使用 AdamW;默认学习率为 6×1056\times10^{-5},沿用 OLMo-3-7B 的 cosine scheduler。

5. 实验设计

5.1 主对照与训练阶段

NCP-ArchPreview 与 OLMo-3-7B 使用相同 staged curriculum:Stage-1 为 Dolma 3 Mix,Stage-2 在 Dolma 3 Dolmino 上继续训练。评测沿用 OLMo-Core 协议,覆盖 MMLU、GSM8K、MATH-500、HumanEval、MBPP、ARC、HellaSwag 等 30 个 benchmark family。

主表将 26 个 higher-is-better 指标按 MMLU、数学、代码、STEM 选择题、非 STEM 选择题和通用问答组织,Overall AVG 是 26 项的未加权平均,不是六个组均值的平均。另有 10 项 gold-completion likelihood,以 bits per UTF-8 byte(BPB,越低越好)单独汇总,不进入 Overall AVG。论文固定 prompt、few-shot 示例、采样配置和随机种子,以减少模型间协议差异。

5.2 参数与计算匹配基线

作者设置四个核心结构:

模型近似参数量近似解析计算
Vanilla OLMo-332Pblk32P_{blk}32Fblk32F_{blk}
Vanilla computation-aligned34Pblk34P_{blk}34Fblk34F_{blk}
Vanilla size-aligned40Pblk40P_{blk}40Fblk40F_{blk}
NCP-ArchPreview40Pblk40P_{blk}34Fblk34F_{blk}

此外,在同一 recipe 的前 200B token 中依次比较 Vanilla+ Concept Module+ Residual+ NCP,用于拆分模块容量、分层路由和辅助目标的贡献。

5.3 多组补充实验

  • 在 1B 模型、150B token 上比较 IRC、CRC、Block AttnRes 和输入级跨模块连接;
  • 101910^{19}102010^{20} FLOPs 预算下搜索模型/数据分配与学习率,拟合 scaling law;
  • 用 Magicoder、Orca-Math、TriviaQA-RC 比较 Full、17M LoRA 和 17M VQ 领域适配;
  • 在 3B 规模比较 NCP 与预测第二个未来 token 的 MTP 是否互补;
  • 将概念状态注入 1.1B DFlash2 风格 drafter,测 GSM8K、MATH、HumanEval、MBPP 的 MAL;
  • 用 177,202 条 expert trajectory、约 100M teacher-suffix token 构造能力分域 proxy,分析 Stage-2 数据 recipe 与下游指标错位。

6. 核心实验结果

6.1 Stage-1:训练损失与多数能力同步改善

指标OLMo-3-7BNCP-ArchPreview差值
最终训练 loss基准低 0.091改善
达到基准最终 loss 所需 token100%51.3%1.95 倍 token 收敛速度
Overall AVG46.5949.04+2.45
MMLU 组平均54.5056.73+2.24
数学组平均20.7924.54+3.75
代码组平均25.1527.79+2.64
非 STEM 选择题平均70.0874.71+4.63
GSM8K39.2745.26+5.99

Stage-1 checkpoint trajectory 中,训练损失整体下降时多数下游能力也持续提升。对“额外概念目标是否真的改善 token 模型”这一问题,这是论文最干净的一组证据,因为数据与评测协议对齐,提升也覆盖多个领域。

但“使用 51.3% token 达到同 loss”不等于训练成本减半。NCP-ArchPreview 每 token 的参数激活与计算高于 32 层 OLMo-3,且有额外状态路由。摘要中的 1.95 倍是 token 收敛效率,不是 GPU-hours 或美元成本倍数。

6.2 Stage-2:总体仍提升,但能力转换不稳定

指标OLMo-3-7BNCP-ArchPreview差值
最终训练 loss基准低 0.027改善
达到基准最终 loss 所需 token100%66.2%1.51 倍 token 收敛速度
Overall AVG56.9857.57+0.59
数学组平均55.6357.39+1.76
MMLU 组平均58.3259.94+1.62
代码组平均39.4238.77-0.65
STEM 选择题平均89.6588.67-0.98

Stage-2 三个 recipe V1、V2、V3 甚至表现出“训练 loss 越低,下游平均越差”。作者将其归因于训练混合分布与 benchmark 分布不匹配,例如 Stage-2 只有约 10% 代码数据。能力专属 proxy 对 V1/V2/V3 的代码、竞赛数学、学术 STEM、逻辑推理排序与对应下游指标一致,说明 recipe 选择需要保留能力向量,不能只盯一个 aggregate loss。

这也限制了论文最强结论:NCP 显著改善优化,但“优化得更好”转换成“目标任务更强”仍依赖数据构成、训练阶段和 checkpoint 选择。

6.3 结构消融支持复合归因

前 200B token 的渐进消融中,加入 Concept Module 后 loss 下降;再加入分层 residual 继续下降;最后加入 NCP 又有额外改善。完整模型明显优于 Vanilla 和 computation-aligned Vanilla,并在仅使用 size-aligned 40 层基线 85% 解析计算时接近其表现。

1B 残差消融进一步显示:无分层连接的 loss 为 2.2588;IRC only 为 2.2315,增加 0.024% 解析 FLOPs;IRC + CRC 最好,为 2.2265,增加 0.051%。Block AttnRes + 跨模块连接为 2.2409。结果支持 IRC/CRC 的作用,但百分比极小的 FLOPs 增量没有覆盖内存与调度开销,不能直接视为部署成本。

6.4 Scaling law 给出 1.74 倍解析计算效率

作者没有直接使用均匀 Transformer 常见的 C6NDC\approx6ND,因为 Concept Module 仅在每个 chunk 运行一次,而是计算 C=FtokDC=F_{tok}D。在多个固定 FLOPs 预算下搜索宽度、Encoder/Concept/Decoder 深度、数据量、学习率和 batch size,再比较各预算最佳 validation loss。拟合曲线显示 NCP-ArchPreview 相对 OLMo-3 有 1.74 倍 compute-optimal 效率。

这比单个 8.9B run 更能说明趋势,但 ladder 只覆盖约 101910^{19}102010^{20} FLOPs;将拟合结果外推到完整 5.73T run 或更大模型仍有不确定性。训练数据、超参数搜索范围和解析 FLOPs 口径也会影响曲线位置。

6.5 VQ 领域适配:更少遗忘、更高训练效率,但上限不同

领域Stage-1 基线17M VQ 后变化关键对照
代码平均30.0432.69+2.65VQ 是唯一四项代码任务都提升的设置
数学平均30.5634.83+4.27高于 LoRA 的 +3.15,低于 Full 的 +6.16
TriviaQA EM40.2849.47+9.19低于 Full +18.00 与 LoRA +17.48

在通用能力保留上,数学适配后的 general average:VQ +0.39、LoRA -0.42、Full -0.97;知识适配时 VQ 仅 +0.03,近似不变。原因也构成其上限:VQ 不改 token 主干的 FFN 等事实记忆载体,所以较难彻底重写知识关联。

效率方面,8 GPU、micro-batch 1 时,VQ 为 15,632 token/s/GPU,LoRA 为 10,400,Full 为 7,739;显存占用分别为 32.4%、49.0%、90.3%。VQ 与 LoRA 都训练 17M 参数,但前者不新增权重,只更新现有码本与预测头。这是有吸引力的适配接口,不过论文没有跨更多领域、数据规模和随机种子验证稳定性。

6.6 NCP 与 MTP 可叠加

3B、150B-token 控制实验中,OLMo-3 + Residual 的平均 LM loss 为 2.3805;加 MTP 后为 2.3739;NCP-ArchPreview 为 2.3707;NCP + MTP 最低,为 2.3664。NCP 单独带来的 -0.0098 大于基线上 MTP 的 -0.0065,二者合并还有进一步收益。

这支持“预测高层 span 表示”和“预测额外未来 token”不是完全重复的监督。但实验只预测第二个未来 token,且在 3B、150B token 设置完成;更长 MTP horizon 与完整 8.9B 训练下是否仍互补尚未展示。

6.7 概念增强 drafter 改善接受长度

作者将最后一个完整 Target chunk 的概念状态经 RMSNorm 和零初始化门控,注入 drafter 每层、每个 proposal position,只增加 0.04M 参数,不增加 Target forward。结果如下:

BenchmarkBaseline MAL+Concept MAL相对增益
GSM8K6.3516.537+2.93%
MATH6.1056.240+2.22%
HumanEval5.4325.845+7.59%
MBPP5.8446.099+4.37%
宏平均5.9336.180+4.17%

MAL 衡量每轮验证提交的 token 数,是推测解码的重要中间指标,但不是吞吐或延迟。论文没有报告加入概念状态后的端到端 tokens/s、首 token 延迟、显存和不同 batch 下的收益,因此应用结论应表述为“提高 draft 接受长度”,而不是“推理必然快 4.17%”。

7. 训练稳定性:Muon 与 Q/K 归一化的交互

使用 OLMo-3 的 layer-wise Q/K normalization 和 full-matrix Muon 时,作者观察到 attention logit 持续增大、少数 head 的 Q/K matrix norm 成为异常值,并伴随 Q/K 与全局梯度 norm spike。解释是 Muon 会耦合多个 attention head 的更新,而 layer-wise normalization 只约束整体尺度,无法独立控制每个 head 的范数与 QK 对齐。

matched ablation 中,per-head Q/K normalization 能抑制这些异常。然而为了与 OLMo-3 保持受控比较,主实验仍使用 layer-wise 版本;per-head 只作为稳定化分析,没有用于取得主结果。这意味着公开训练 recipe 的复现者需要特别监控 head-level logit 和 gradient,而不能只根据最终成功 run 认为默认配置天然稳定。

8. 局限与批判性分析

8.1 “概念”的语义性尚未被充分解释

概念是四个相邻 token 隐藏状态的均值与 PQ 代码组合。论文证明了它可预测、可用于适配和 drafting,却没有系统展示码字对应哪些可读语义、不同语言是否共享概念、固定四 token 边界如何处理词法与句法错位,或码本是否存在 collapse、冗余和随训练漂移。它首先是有效的离散 latent,不应直接等同于人类概念。

8.2 更低 loss 不保证所有下游任务更强

Stage-2 已给出明确反例:总体 loss 更低,代码和 STEM 选择题却下降;三个 Stage-2 recipe 的 loss 排序也与多项能力排序相反。论文的 proxy 分析提供了诊断方案,但只覆盖同一模型的三种 matched-budget recipe,不能证明对新模型家族或新领域有校准预测力。

8.3 真实计算成本缺少完整报告

主要效率数字分别是按 token 达到目标 loss、解析 FLOPs 匹配和 scaling fit。尚缺:完整训练 wall-clock、GPU-hours、Model FLOPs Utilization、通信占比、激活显存、checkpoint 开销和实际 tokens/s。分层 residual 的状态保存和跨模块混合尤其可能是 memory-bound 成本。

8.4 长上下文仍未验证

主模型最大训练长度是 8,192,论文明确将 long-context training 留给未来。概念流缩短四倍,理论上更适合长依赖,但局部 attention、固定 chunk、位置编码、跨模块路由和概念预测误差在 32K、128K 乃至更长上下文是否仍稳定,没有实验证据。

8.5 比较范围主要围绕 OLMo-3

同数据、同协议的 OLMo-3 对照增强了内部归因,却也限制外部有效性。尚不清楚 NCP 与 MoE、GQA、更激进的 MTP、不同 tokenizer、非 Muon 优化器或现代 post-training recipe 组合后是否保留相同比例收益。

8.6 训练后应用证据仍是小范围验证

VQ 适配只覆盖代码、数学和 TriviaQA;drafter 只覆盖四个 reasoning/code benchmark;适配结果没有多随机种子置信区间。知识适配中 VQ 的目标增益显著低于 Full/LoRA,也说明“不动主干”既是保留能力的优点,也是修改深层知识的限制。

8.7 基础模型的通用风险没有消失

NCP-ArchPreview 是 base model,而不是完成对话对齐和安全训练的产品模型。更高训练效率不会自动解决幻觉、偏见、隐私、版权、越权工具调用与生成有害内容等风险。概念空间增加了新的适配面,也需要研究码本投毒、领域偏移和 latent 操纵问题。

9. 应用影响

9.1 对基础模型预训练

最直接的价值是提供一个可规模化的非 vanilla 架构候选:把部分容量放到更短的潜序列上,并以显式未来概念目标训练。若真实硬件 profiling 证实解析效率,团队可以在相同训练预算内探索更低 loss,或在相同目标 loss 下减少数据 token。采用前必须把通信、激活与 kernel 成本纳入预算,而不是直接套用 1.95 倍数字。

9.2 对领域适配与持续学习

17M VQ 接口适合需要低显存、较少灾难性遗忘的场景,尤其是数学和代码风格适配。它也可能支持为不同领域维护小型码本版本,而共享一个冻结 token 主干。但事实知识需要改写 FFN 等主干存储时,VQ 的表达上限会低于 LoRA 或全参训练。

9.3 对推测解码

概念状态天然覆盖多个 token,可作为 block drafter 的规划信号。它与 token 级 Target hidden state 互补,特别是在 HumanEval 上带来更长接受前缀。下一步应在 vLLM/SGLang 等服务栈中报告 batch、上下文和硬件分层的 end-to-end Pareto 曲线。

9.4 对模型分析与数据选择

NCP 提供了可单独观察的码本占用、概念预测误差和跨层路由权重,可能成为训练诊断信号。论文的能力分域 proxy 也说明,中期训练 recipe 应按代码、数学、STEM、逻辑等能力分别评估,而不应由总体 cross-entropy 独占 checkpoint 选择。

9.5 对未来架构研究

值得继续验证的方向包括动态概念边界、多尺度 chunk、可解释码本、跨语言概念共享、MoE Concept Module、长上下文概念记忆,以及 NCP 与 MTP、RL、工具使用和 multimodal latent 的组合。真正关键的问题不是“概念能否替代 token”,而是怎样让多尺度目标在不破坏 token 接口的前提下提供稳定、可量化的额外监督。

10. 相关工作脉络

10.1 JEPA 与抽象级预测

I-JEPA、V-JEPA 和 V-JEPA 2 通过预测 latent target 学习忽略表层噪声、保留可预测结构的表示;Large Concept Model 则把句子映射到连续概念空间进行自回归建模。NCP-ArchPreview 的差异是概念空间由语言模型自身隐藏状态和离散 PQ 码本共同形成,并继续服务 token 生成。

10.2 层级与潜空间语言模型

Hourglass Transformer、MegaByte 采用固定压缩层级;BLT、H-Net、DLCM 使用输入自适应的 patch 或 chunk;ContextLM 学习可预测的 context embedding。这些工作主要改变计算粒度或 latent unit 的构造。NCP-ArchPreview 固定四 token 一组,把重点放在“预测下一离散潜表示并反馈给 token 流”。

10.3 NCP 与 MTP

MTP 为多个未来 token 添加监督,目标仍是表层符号。ConceptLM 首次提出从模型隐藏状态学习乘积量化概念词表,并联合 NCP 与 token 生成,是本文最直接的基础。NCP-ArchPreview 的主要推进在于从预训练开始扩展到 8.9B/5.73T,而非在较小模型或已有 8B 模型的 continual pretraining 中追加目标。

10.4 深层残差路由

DenseFormer 使用与输入无关的深度加权;DeepCrossAttention、MUDDFormer、Attention Residuals、Depth-Attention 则以不同方式动态选择早期层状态。本文的 IRC 借鉴 MUDDFormer 的单流 dynamic dense connection,CRC 再将深度选择扩展到三个不同分辨率模块之间。

11. 结论

NCP-ArchPreview 给出了目前最大规模的离散潜空间语言模型验证:在标准 token 自回归接口内,模型可以同时学习下一 token 与下一概念,并在 8.94B 参数、5.73T token 训练中获得稳定的优化优势。参数/计算匹配、组件消融和 scaling ladder 共同支持“收益不只来自增加层数”;VQ 适配与 drafter 实验又说明概念空间具有训练后的复用价值。

这篇论文最可信的结论是:显式预测由模型自身学习的多 token 潜表示,可以成为 NTP 的有效补充,并在大规模预训练中改善 loss—解析计算曲线。 更强的说法仍需保留条件:1.95 倍是 token 收敛速度,1.74 倍来自 scaling-law 解析计算拟合,4.17% 是 drafter 接受长度提升;它们都不是未经测量即可等同的端到端成本或服务加速。

若后续版本补齐长上下文、跨架构复现、真实 GPU-hours、服务吞吐和概念可解释性,NCP 才可能从一个成功的 architecture preview 进一步成为通用预训练范式。当前证据已经足以说明,语言模型的下一步不一定是放弃 token,而可能是在 token 之上增加一个可学习、可预测、可复用的抽象层。

参考资料

  1. NCP Team. NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction, 2026.
  2. Hugging Face. NCP-ArchPreview Paper Page.
  3. NCP Team. NCP-ArchPreview Model Collection.
  4. Liu et al. Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models, 2026.
  5. Groeneveld et al. OLMo 3, 2025.
  6. Gloeckle et al. Better & Faster Large Language Models via Multi-token Prediction, 2024.
  7. Nawrot et al. Hierarchical Transformers Are More Efficient Language Models, 2021.
  8. Yu et al. MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers, 2023.
  9. Pagnoni et al. Byte Latent Transformer: Patches Scale Better Than Tokens, 2024.
  10. LeCun. A Path Towards Autonomous Machine Intelligence, 2022.