NCP-ArchPreview
NCP-ArchPreview 硅基写手深入解析 NCP-ArchPreview 如何在标准自回归语言模型中联合训练下一词元与下一概念预测,并以乘积量化、概念模块和分层残差提升万亿词元预训练效率;结合匹配基线、领域适配和推测解码实验,审视其收益、成本与证据边界。
自动研究时间:2026-09-12 09:04(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 11,列表最顶部为 NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv v1 全文 PDF、完整 TeX 源码与附录 -> 官方模型集合。
执行摘要
标准大语言模型用 Next Token Prediction(NTP)学习“给定前文,下一个 token 是什么”。这个目标密集、稳定、易于扩展,却只在表层 token 上直接监督模型;跨越多个 token 的语义结构即使出现在隐藏状态里,也只是训练的副产品。NCP-ArchPreview 的核心主张是:保留 NTP 和普通逐 token 生成接口,同时显式要求模型预测下一个多 token 概念。
模型把 OLMo-3-7B 的 32 个 token 层拆成 16 层 Token Encoder 和 16 层 Token Decoder,中间插入 8 层 Concept Module。Encoder 每四个 token 的隐藏状态做均值池化,得到长度缩短为四分之一的连续概念序列;再将每个 4,096 维概念切成 32 段,每段在 128 个码字中量化。Concept Module 不直接输出一个硬离散编号,而是预测各段码本上的概率分布,以码字加权和形成可微的下一概念表示。该表示重复到 token 分辨率、整体因果移位一个 chunk 后注入 Decoder,从而在不偷看目标 token 的前提下提供较高层的预测信号。
这不是用“概念 token”替换文本 token。训练仍以 NTP 为主,并联合 Next Concept Prediction(NCP)和 Vector Quantization(VQ)损失;推理的外部契约仍是标准自回归语言模型。架构额外引入 Intra-Module Residual Connections(IRC)和 Cross-Module Residual Connections(CRC),动态复用同一模块的不同深度,并在 Encoder、Concept Module、Decoder 之间传递对齐后的中间状态。
作者将模型扩展到 8.94B 参数、5.73T Dolma-3 token。在 Stage-1,同数据训练下,它使用 OLMo-3-7B 的 51.3% token 就达到对方最终训练损失,相当于按 token 数计算的 1.95 倍收敛速度;最终损失低 0.091,26 项高分优先指标的宏平均从 46.59 提高到 49.04,提升 2.45 分,其中 GSM8K 提高 5.99 分。Stage-2 的优势缩小为平均 +0.59,代码类别反而下降 0.65 分,说明更低的总体训练损失并不自动转化为所有下游能力同步增强。
论文用参数匹配、计算匹配和渐进组件消融证明收益不只是“多加了八层”。Concept Module 在四分之一序列长度上工作,因此全模型约有 40 个标准 block 的参数量,却只有约 34 个 block 的解析计算量;完整模型用参数匹配 40 层基线 85% 的解析 FLOPs 接近其损失。独立 scaling ladder 则给出相对 OLMo-3 的 1.74 倍 compute-optimal 效率。不过这些主要是解析 FLOPs 和 loss 曲线,论文没有给出 5.73T 训练的端到端墙钟时间、通信开销或每 token 吞吐;层间状态物化、内存流量和小 kernel 调度也未包含在主要 FLOPs 口径中。
概念空间还被用于两个训练后场景。只更新已有的 17M VQ 码本与概念预测头,可以用比同参数 LoRA 更高的吞吐、更低的显存做代码、数学和知识适配;把上一完整 chunk 的概念状态注入 DFlash2 风格的 block-parallel drafter,则把四项任务的 Mean Accepted Length(MAL)从 5.933 提高到 6.180,平均相对增益 4.17%。这些结果说明潜空间可以成为可复用接口,但尚不能证明最终服务延迟同比下降,也不能把有限领域上的适配收益外推为通用知识编辑能力。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction |
| 模型名称 | NCP-ArchPreview |
| 论文编号 | arXiv:2609.10715 |
| 当前版本 | v1,2026-09-09 提交 |
| 作者 | The Intern-NCP Team:Jiaqi Cao、Chiyu Chen、Shuang Cheng、Xu Cheng、Beiya Dai、Yufan Feng、Kewen Ge、Ruijun Ge、Jiayi Huang、Yang Jiao、Dahua Lin、Zhouhan Lin、Yifan Liu、Yuliang Liu、Biqing Qi、Mowen Ruan、Junzhe Shen、Yunchong Song、Hao Sun、Zhongbo Tian、Yixuan Wang、Rubin Wei、Jiaxin Xiong、Kangyu Yang、Qian Yao、Qi Zhang、Bowen Zhou |
| 机构 | Shanghai AI Lab;LUMIA Lab,Shanghai Jiao Tong University |
| 基础架构 | OLMo-3-7B |
| 规模 | 8.94B 参数;5.73T 预训练 token;最大训练长度 8,192 |
| 训练数据 | Stage-1:Dolma 3 Mix;Stage-2:Dolma 3 Dolmino |
| 核心机制 | NTP + NCP + VQ;Concept Module;IRC + CRC |
| 开放内容 | Stage-1/Stage-2 权重、中间 checkpoint、drafter、推理脚本、训练 recipe 与评测代码 |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2609.10715
- arXiv 摘要页:https://arxiv.org/abs/2609.10715
- arXiv PDF:https://arxiv.org/pdf/2609.10715
- arXiv 完整源码:https://arxiv.org/e-print/2609.10715
- Hugging Face 官方模型集合:https://huggingface.co/collections/ArchSpace-Collection/ncp-archpreview
- 推理与部署代码:https://github.com/InternLM/lmdeploy
- 官方评测代码:https://github.com/LUMIA-Group/ncp_olmo_eval
2. 背景与动机:token 是输出接口,不必是唯一学习尺度
2.1 NTP 的成功与粒度限制
标准因果语言模型优化:
它的优势是每个位置都有监督,训练和采样接口统一,扩展到万亿 token 已有成熟工程路径。但 token 通常只是词的一部分、标点或短词。模型要回答数学题、写程序或维持段落主题,内部必须形成跨 token 的对象、关系和计划;NTP 并未直接规定这些中间抽象应该是什么,更没有要求模型预测它们怎样演进。
视觉生成已经展示了在压缩 latent 中建模的效率,JEPA 路线也强调预测表示而非还原每个细节。语言领域的难点在于:latent 既要承载多 token 语义,又不能破坏标准 token 生成,更不能让训练时的未来信息泄漏到当前预测。
2.2 既有路线解决了问题的一部分
| 路线 | 代表工作 | 与 NCP-ArchPreview 的区别 |
|---|---|---|
| 固定层级/patch | Hourglass Transformer、MegaByte、ContextLM | 压缩序列或改变计算粒度,但未必学习离散概念预测目标 |
| 动态 chunk | BLT、H-Net、DLCM | 根据输入选择边界或 patch 大小;NCP-ArchPreview 固定每四 token 聚合 |
| 句子级连续概念 | Large Concept Model | 在外部或共享连续句向量空间预测;本文从自身隐藏状态学习码本 |
| 多 token 预测 | MTP | 辅助头仍预测多个表层 token;NCP 预测一个压缩的 latent span 表示 |
| 连续 latent reasoning | latent thought、continuous concept 方法 | 依赖连续状态;本文用 product quantization 约束目标空间 |
| 离散概念预测 | ConceptLM | NCP 的直接前作,验证到从头训练 1.5B 和继续预训练 8B;本文从一开始在 8.9B、5.73T token 规模训练 |
因此,本工作的主要科学增量并不是第一次提出 NCP,而是把这一目标嵌入可从头扩展的 foundation-model 架构,并在参数、计算、数据和训练阶段控制下验证其规模化表现。
3. 核心贡献
3.1 同时预测 token 和离散概念
NCP-ArchPreview 保留 token 级主干,把高层预测作为并行目标和反馈信号。概念由模型自己的 Encoder 隐藏状态形成,无需外部句子编码器或人工语义标签;离散码本让预测被限制在学习到的概念原型组合附近,而不是在任意连续向量中自由回归。
这种设计试图兼顾三点:
- 外部兼容:输入输出仍是普通 token,可复用自回归训练、评测与部署接口;
- 更长监督跨度:每个概念总结四个 token,要求模型显式预测下一段隐藏结构;
- 内部可复用性:码本和概念状态可以继续服务领域适配与并行 drafter。
3.2 在短序列上增加模型容量
8 层 Concept Module 的参数量近似 8 个标准 Transformer block,但输入长度只有 token 流的四分之一。作者的近似口径是:一个概念层拥有约一个 token 层的参数,却使用不到四分之一的解析训练 FLOPs。这使模型能以较小计算增量增加深度与表达能力。
需要谨慎区分“参数效率”和“运行效率”。Concept Module 降低了主矩阵运算量,但 IRC/CRC 仍要保存、归一化、选择和搬运多层状态。论文自己承认解析 FLOPs 未计入状态物化、内存访问、归约和小 kernel launch,因此真实硬件收益必须由端到端 profiling 验证。
3.3 分层残差让跨深度、跨尺度信息可选择地流动
普通 Transformer 的残差把上一层状态固定相加。IRC 让每层根据当前状态,为同一模块内从输入到当前深度的候选状态生成未归一化、可带符号的混合系数;初始化时只选择最近状态,所以训练起点接近标准残差。
CRC 则在三个模块之间建立:
- Token Encoder -> Concept Module;
- Token Encoder -> Token Decoder;
- Concept Module -> Token Decoder。
源模块多个深度的状态先经 LayerNorm,再由目标状态生成的 softmax 权重混合,最后通过学习到的逐维缩放注入目标流。跨 token/概念分辨率时使用 chunk pooling 或重复与因果移位。这样,概念层不只读取 Encoder 最后一层,Decoder 也不只接收一个最终概念向量。
3.4 把概念空间变成训练后的轻量接口
论文不把 VQ 码本视为一次性辅助损失。冻结 8.9B token 主干,只更新 17M 码本和预测头,即可做领域适配;同一概念状态还可为推测解码的 drafter 提供跨多个未来位置的上下文。这两项实验共同支持一个更长远的设计观点:基础模型内部若有明确的潜空间接口,后续能力不一定都要通过全参微调或额外大模块注入。
4. 方法详解
4.1 三段式主干
| 模块 | 配置 | 作用 |
|---|---|---|
| Token Encoder | 16 个 causal Transformer 层 | 产生 token 隐藏状态,也是概念构造来源 |
| Concept Module | 8 个 causal Transformer 层 | 在压缩序列上预测下一概念 |
| Token Decoder | 16 个 causal Transformer 层 | 融合 token 与因果可用概念,输出下一 token |
其他关键配置包括 hidden size 4,096、FFN size 11,008、32 个 attention head、词表 100,278、RoPE base 500,000、token 局部注意力窗口 4,096,并每四层使用一次 full attention。参数为 BF16,主实验最大训练长度 8,192。
4.2 从四个 token 得到一个连续概念
Token Encoder 将输入映射为 。压缩因子 ,第 个概念是连续四个隐藏状态的均值:
因此 Concept Module 的序列长度约为 。这里“concept”是训练得到的潜表示,不是经人工标注的词义、实体或命题;四 token 的固定窗口也不保证与自然语言语义边界一致。这个名称表达其预期功能,而不是已被可解释性实验严格证明的本体类别。
4.3 乘积量化构造组合式概念词表
每个 4,096 维概念切成 个 128 维片段;每段各有 个码字,并选择最近的码字:
单段码本很小,但 32 段组合理论上形成 种可能代码。VQ 损失只把选中的码字拉向停止梯度后的连续概念:
由于对 做 stop-gradient,VQ 拟合本身不会直接改写 Token Encoder;它让码本跟踪隐藏状态分布。
4.4 下一概念预测保持可微
Concept Module 读取此前连续概念 ,对每个片段输出 128 个码字的概率。模型不用 argmax 选一个码字,而计算期望:
NCP 损失让预测概念逼近停止梯度后的下一连续概念:
预测目标不向 Encoder 反传,但 Concept Module 的历史输入没有 detach,因此 Encoder 会通过“怎样编码过去,才能更好预测未来概念”收到 NCP 梯度。这一细节避免目标与表示共同无约束漂移,同时仍允许辅助任务塑造上游表示。
4.5 因果移位防止训练泄漏
若把由第 个 token chunk 算出的概念直接送回同一 chunk,Decoder 会间接看到目标 token。作者先把预测概念重复四次恢复 token 分辨率,再整体移位 ;前缀用零填充。随后与 Encoder 状态相加:
Concept Module -> Decoder 的 CRC 也使用同样移位。于是当前 token 只能利用由已经处理完成的更早 chunk 产生的概念信号,NTP 仍是合法的因果目标。
4.6 三个损失端到端联合优化
总目标为:
NTP 为全部路径提供密集监督;NCP 训练概念预测并塑造历史概念表示;VQ 让码本适配概念分布。矩阵参数使用 Moonlight Muon,embedding、bias 等参数使用 AdamW;默认学习率为 ,沿用 OLMo-3-7B 的 cosine scheduler。
5. 实验设计
5.1 主对照与训练阶段
NCP-ArchPreview 与 OLMo-3-7B 使用相同 staged curriculum:Stage-1 为 Dolma 3 Mix,Stage-2 在 Dolma 3 Dolmino 上继续训练。评测沿用 OLMo-Core 协议,覆盖 MMLU、GSM8K、MATH-500、HumanEval、MBPP、ARC、HellaSwag 等 30 个 benchmark family。
主表将 26 个 higher-is-better 指标按 MMLU、数学、代码、STEM 选择题、非 STEM 选择题和通用问答组织,Overall AVG 是 26 项的未加权平均,不是六个组均值的平均。另有 10 项 gold-completion likelihood,以 bits per UTF-8 byte(BPB,越低越好)单独汇总,不进入 Overall AVG。论文固定 prompt、few-shot 示例、采样配置和随机种子,以减少模型间协议差异。
5.2 参数与计算匹配基线
作者设置四个核心结构:
| 模型 | 近似参数量 | 近似解析计算 |
|---|---|---|
| Vanilla OLMo-3 | ||
| Vanilla computation-aligned | ||
| Vanilla size-aligned | ||
| NCP-ArchPreview |
此外,在同一 recipe 的前 200B token 中依次比较 Vanilla、+ Concept Module、+ Residual、+ NCP,用于拆分模块容量、分层路由和辅助目标的贡献。
5.3 多组补充实验
- 在 1B 模型、150B token 上比较 IRC、CRC、Block AttnRes 和输入级跨模块连接;
- 在 到 FLOPs 预算下搜索模型/数据分配与学习率,拟合 scaling law;
- 用 Magicoder、Orca-Math、TriviaQA-RC 比较 Full、17M LoRA 和 17M VQ 领域适配;
- 在 3B 规模比较 NCP 与预测第二个未来 token 的 MTP 是否互补;
- 将概念状态注入 1.1B DFlash2 风格 drafter,测 GSM8K、MATH、HumanEval、MBPP 的 MAL;
- 用 177,202 条 expert trajectory、约 100M teacher-suffix token 构造能力分域 proxy,分析 Stage-2 数据 recipe 与下游指标错位。
6. 核心实验结果
6.1 Stage-1:训练损失与多数能力同步改善
| 指标 | OLMo-3-7B | NCP-ArchPreview | 差值 |
|---|---|---|---|
| 最终训练 loss | 基准 | 低 0.091 | 改善 |
| 达到基准最终 loss 所需 token | 100% | 51.3% | 1.95 倍 token 收敛速度 |
| Overall AVG | 46.59 | 49.04 | +2.45 |
| MMLU 组平均 | 54.50 | 56.73 | +2.24 |
| 数学组平均 | 20.79 | 24.54 | +3.75 |
| 代码组平均 | 25.15 | 27.79 | +2.64 |
| 非 STEM 选择题平均 | 70.08 | 74.71 | +4.63 |
| GSM8K | 39.27 | 45.26 | +5.99 |
Stage-1 checkpoint trajectory 中,训练损失整体下降时多数下游能力也持续提升。对“额外概念目标是否真的改善 token 模型”这一问题,这是论文最干净的一组证据,因为数据与评测协议对齐,提升也覆盖多个领域。
但“使用 51.3% token 达到同 loss”不等于训练成本减半。NCP-ArchPreview 每 token 的参数激活与计算高于 32 层 OLMo-3,且有额外状态路由。摘要中的 1.95 倍是 token 收敛效率,不是 GPU-hours 或美元成本倍数。
6.2 Stage-2:总体仍提升,但能力转换不稳定
| 指标 | OLMo-3-7B | NCP-ArchPreview | 差值 |
|---|---|---|---|
| 最终训练 loss | 基准 | 低 0.027 | 改善 |
| 达到基准最终 loss 所需 token | 100% | 66.2% | 1.51 倍 token 收敛速度 |
| Overall AVG | 56.98 | 57.57 | +0.59 |
| 数学组平均 | 55.63 | 57.39 | +1.76 |
| MMLU 组平均 | 58.32 | 59.94 | +1.62 |
| 代码组平均 | 39.42 | 38.77 | -0.65 |
| STEM 选择题平均 | 89.65 | 88.67 | -0.98 |
Stage-2 三个 recipe V1、V2、V3 甚至表现出“训练 loss 越低,下游平均越差”。作者将其归因于训练混合分布与 benchmark 分布不匹配,例如 Stage-2 只有约 10% 代码数据。能力专属 proxy 对 V1/V2/V3 的代码、竞赛数学、学术 STEM、逻辑推理排序与对应下游指标一致,说明 recipe 选择需要保留能力向量,不能只盯一个 aggregate loss。
这也限制了论文最强结论:NCP 显著改善优化,但“优化得更好”转换成“目标任务更强”仍依赖数据构成、训练阶段和 checkpoint 选择。
6.3 结构消融支持复合归因
前 200B token 的渐进消融中,加入 Concept Module 后 loss 下降;再加入分层 residual 继续下降;最后加入 NCP 又有额外改善。完整模型明显优于 Vanilla 和 computation-aligned Vanilla,并在仅使用 size-aligned 40 层基线 85% 解析计算时接近其表现。
1B 残差消融进一步显示:无分层连接的 loss 为 2.2588;IRC only 为 2.2315,增加 0.024% 解析 FLOPs;IRC + CRC 最好,为 2.2265,增加 0.051%。Block AttnRes + 跨模块连接为 2.2409。结果支持 IRC/CRC 的作用,但百分比极小的 FLOPs 增量没有覆盖内存与调度开销,不能直接视为部署成本。
6.4 Scaling law 给出 1.74 倍解析计算效率
作者没有直接使用均匀 Transformer 常见的 ,因为 Concept Module 仅在每个 chunk 运行一次,而是计算 。在多个固定 FLOPs 预算下搜索宽度、Encoder/Concept/Decoder 深度、数据量、学习率和 batch size,再比较各预算最佳 validation loss。拟合曲线显示 NCP-ArchPreview 相对 OLMo-3 有 1.74 倍 compute-optimal 效率。
这比单个 8.9B run 更能说明趋势,但 ladder 只覆盖约 – FLOPs;将拟合结果外推到完整 5.73T run 或更大模型仍有不确定性。训练数据、超参数搜索范围和解析 FLOPs 口径也会影响曲线位置。
6.5 VQ 领域适配:更少遗忘、更高训练效率,但上限不同
| 领域 | Stage-1 基线 | 17M VQ 后 | 变化 | 关键对照 |
|---|---|---|---|---|
| 代码平均 | 30.04 | 32.69 | +2.65 | VQ 是唯一四项代码任务都提升的设置 |
| 数学平均 | 30.56 | 34.83 | +4.27 | 高于 LoRA 的 +3.15,低于 Full 的 +6.16 |
| TriviaQA EM | 40.28 | 49.47 | +9.19 | 低于 Full +18.00 与 LoRA +17.48 |
在通用能力保留上,数学适配后的 general average:VQ +0.39、LoRA -0.42、Full -0.97;知识适配时 VQ 仅 +0.03,近似不变。原因也构成其上限:VQ 不改 token 主干的 FFN 等事实记忆载体,所以较难彻底重写知识关联。
效率方面,8 GPU、micro-batch 1 时,VQ 为 15,632 token/s/GPU,LoRA 为 10,400,Full 为 7,739;显存占用分别为 32.4%、49.0%、90.3%。VQ 与 LoRA 都训练 17M 参数,但前者不新增权重,只更新现有码本与预测头。这是有吸引力的适配接口,不过论文没有跨更多领域、数据规模和随机种子验证稳定性。
6.6 NCP 与 MTP 可叠加
3B、150B-token 控制实验中,OLMo-3 + Residual 的平均 LM loss 为 2.3805;加 MTP 后为 2.3739;NCP-ArchPreview 为 2.3707;NCP + MTP 最低,为 2.3664。NCP 单独带来的 -0.0098 大于基线上 MTP 的 -0.0065,二者合并还有进一步收益。
这支持“预测高层 span 表示”和“预测额外未来 token”不是完全重复的监督。但实验只预测第二个未来 token,且在 3B、150B token 设置完成;更长 MTP horizon 与完整 8.9B 训练下是否仍互补尚未展示。
6.7 概念增强 drafter 改善接受长度
作者将最后一个完整 Target chunk 的概念状态经 RMSNorm 和零初始化门控,注入 drafter 每层、每个 proposal position,只增加 0.04M 参数,不增加 Target forward。结果如下:
| Benchmark | Baseline MAL | +Concept MAL | 相对增益 |
|---|---|---|---|
| GSM8K | 6.351 | 6.537 | +2.93% |
| MATH | 6.105 | 6.240 | +2.22% |
| HumanEval | 5.432 | 5.845 | +7.59% |
| MBPP | 5.844 | 6.099 | +4.37% |
| 宏平均 | 5.933 | 6.180 | +4.17% |
MAL 衡量每轮验证提交的 token 数,是推测解码的重要中间指标,但不是吞吐或延迟。论文没有报告加入概念状态后的端到端 tokens/s、首 token 延迟、显存和不同 batch 下的收益,因此应用结论应表述为“提高 draft 接受长度”,而不是“推理必然快 4.17%”。
7. 训练稳定性:Muon 与 Q/K 归一化的交互
使用 OLMo-3 的 layer-wise Q/K normalization 和 full-matrix Muon 时,作者观察到 attention logit 持续增大、少数 head 的 Q/K matrix norm 成为异常值,并伴随 Q/K 与全局梯度 norm spike。解释是 Muon 会耦合多个 attention head 的更新,而 layer-wise normalization 只约束整体尺度,无法独立控制每个 head 的范数与 QK 对齐。
matched ablation 中,per-head Q/K normalization 能抑制这些异常。然而为了与 OLMo-3 保持受控比较,主实验仍使用 layer-wise 版本;per-head 只作为稳定化分析,没有用于取得主结果。这意味着公开训练 recipe 的复现者需要特别监控 head-level logit 和 gradient,而不能只根据最终成功 run 认为默认配置天然稳定。
8. 局限与批判性分析
8.1 “概念”的语义性尚未被充分解释
概念是四个相邻 token 隐藏状态的均值与 PQ 代码组合。论文证明了它可预测、可用于适配和 drafting,却没有系统展示码字对应哪些可读语义、不同语言是否共享概念、固定四 token 边界如何处理词法与句法错位,或码本是否存在 collapse、冗余和随训练漂移。它首先是有效的离散 latent,不应直接等同于人类概念。
8.2 更低 loss 不保证所有下游任务更强
Stage-2 已给出明确反例:总体 loss 更低,代码和 STEM 选择题却下降;三个 Stage-2 recipe 的 loss 排序也与多项能力排序相反。论文的 proxy 分析提供了诊断方案,但只覆盖同一模型的三种 matched-budget recipe,不能证明对新模型家族或新领域有校准预测力。
8.3 真实计算成本缺少完整报告
主要效率数字分别是按 token 达到目标 loss、解析 FLOPs 匹配和 scaling fit。尚缺:完整训练 wall-clock、GPU-hours、Model FLOPs Utilization、通信占比、激活显存、checkpoint 开销和实际 tokens/s。分层 residual 的状态保存和跨模块混合尤其可能是 memory-bound 成本。
8.4 长上下文仍未验证
主模型最大训练长度是 8,192,论文明确将 long-context training 留给未来。概念流缩短四倍,理论上更适合长依赖,但局部 attention、固定 chunk、位置编码、跨模块路由和概念预测误差在 32K、128K 乃至更长上下文是否仍稳定,没有实验证据。
8.5 比较范围主要围绕 OLMo-3
同数据、同协议的 OLMo-3 对照增强了内部归因,却也限制外部有效性。尚不清楚 NCP 与 MoE、GQA、更激进的 MTP、不同 tokenizer、非 Muon 优化器或现代 post-training recipe 组合后是否保留相同比例收益。
8.6 训练后应用证据仍是小范围验证
VQ 适配只覆盖代码、数学和 TriviaQA;drafter 只覆盖四个 reasoning/code benchmark;适配结果没有多随机种子置信区间。知识适配中 VQ 的目标增益显著低于 Full/LoRA,也说明“不动主干”既是保留能力的优点,也是修改深层知识的限制。
8.7 基础模型的通用风险没有消失
NCP-ArchPreview 是 base model,而不是完成对话对齐和安全训练的产品模型。更高训练效率不会自动解决幻觉、偏见、隐私、版权、越权工具调用与生成有害内容等风险。概念空间增加了新的适配面,也需要研究码本投毒、领域偏移和 latent 操纵问题。
9. 应用影响
9.1 对基础模型预训练
最直接的价值是提供一个可规模化的非 vanilla 架构候选:把部分容量放到更短的潜序列上,并以显式未来概念目标训练。若真实硬件 profiling 证实解析效率,团队可以在相同训练预算内探索更低 loss,或在相同目标 loss 下减少数据 token。采用前必须把通信、激活与 kernel 成本纳入预算,而不是直接套用 1.95 倍数字。
9.2 对领域适配与持续学习
17M VQ 接口适合需要低显存、较少灾难性遗忘的场景,尤其是数学和代码风格适配。它也可能支持为不同领域维护小型码本版本,而共享一个冻结 token 主干。但事实知识需要改写 FFN 等主干存储时,VQ 的表达上限会低于 LoRA 或全参训练。
9.3 对推测解码
概念状态天然覆盖多个 token,可作为 block drafter 的规划信号。它与 token 级 Target hidden state 互补,特别是在 HumanEval 上带来更长接受前缀。下一步应在 vLLM/SGLang 等服务栈中报告 batch、上下文和硬件分层的 end-to-end Pareto 曲线。
9.4 对模型分析与数据选择
NCP 提供了可单独观察的码本占用、概念预测误差和跨层路由权重,可能成为训练诊断信号。论文的能力分域 proxy 也说明,中期训练 recipe 应按代码、数学、STEM、逻辑等能力分别评估,而不应由总体 cross-entropy 独占 checkpoint 选择。
9.5 对未来架构研究
值得继续验证的方向包括动态概念边界、多尺度 chunk、可解释码本、跨语言概念共享、MoE Concept Module、长上下文概念记忆,以及 NCP 与 MTP、RL、工具使用和 multimodal latent 的组合。真正关键的问题不是“概念能否替代 token”,而是怎样让多尺度目标在不破坏 token 接口的前提下提供稳定、可量化的额外监督。
10. 相关工作脉络
10.1 JEPA 与抽象级预测
I-JEPA、V-JEPA 和 V-JEPA 2 通过预测 latent target 学习忽略表层噪声、保留可预测结构的表示;Large Concept Model 则把句子映射到连续概念空间进行自回归建模。NCP-ArchPreview 的差异是概念空间由语言模型自身隐藏状态和离散 PQ 码本共同形成,并继续服务 token 生成。
10.2 层级与潜空间语言模型
Hourglass Transformer、MegaByte 采用固定压缩层级;BLT、H-Net、DLCM 使用输入自适应的 patch 或 chunk;ContextLM 学习可预测的 context embedding。这些工作主要改变计算粒度或 latent unit 的构造。NCP-ArchPreview 固定四 token 一组,把重点放在“预测下一离散潜表示并反馈给 token 流”。
10.3 NCP 与 MTP
MTP 为多个未来 token 添加监督,目标仍是表层符号。ConceptLM 首次提出从模型隐藏状态学习乘积量化概念词表,并联合 NCP 与 token 生成,是本文最直接的基础。NCP-ArchPreview 的主要推进在于从预训练开始扩展到 8.9B/5.73T,而非在较小模型或已有 8B 模型的 continual pretraining 中追加目标。
10.4 深层残差路由
DenseFormer 使用与输入无关的深度加权;DeepCrossAttention、MUDDFormer、Attention Residuals、Depth-Attention 则以不同方式动态选择早期层状态。本文的 IRC 借鉴 MUDDFormer 的单流 dynamic dense connection,CRC 再将深度选择扩展到三个不同分辨率模块之间。
11. 结论
NCP-ArchPreview 给出了目前最大规模的离散潜空间语言模型验证:在标准 token 自回归接口内,模型可以同时学习下一 token 与下一概念,并在 8.94B 参数、5.73T token 训练中获得稳定的优化优势。参数/计算匹配、组件消融和 scaling ladder 共同支持“收益不只来自增加层数”;VQ 适配与 drafter 实验又说明概念空间具有训练后的复用价值。
这篇论文最可信的结论是:显式预测由模型自身学习的多 token 潜表示,可以成为 NTP 的有效补充,并在大规模预训练中改善 loss—解析计算曲线。 更强的说法仍需保留条件:1.95 倍是 token 收敛速度,1.74 倍来自 scaling-law 解析计算拟合,4.17% 是 drafter 接受长度提升;它们都不是未经测量即可等同的端到端成本或服务加速。
若后续版本补齐长上下文、跨架构复现、真实 GPU-hours、服务吞吐和概念可解释性,NCP 才可能从一个成功的 architecture preview 进一步成为通用预训练范式。当前证据已经足以说明,语言模型的下一步不一定是放弃 token,而可能是在 token 之上增加一个可学习、可预测、可复用的抽象层。
参考资料
- NCP Team. NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction, 2026.
- Hugging Face. NCP-ArchPreview Paper Page.
- NCP Team. NCP-ArchPreview Model Collection.
- Liu et al. Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models, 2026.
- Groeneveld et al. OLMo 3, 2025.
- Gloeckle et al. Better & Faster Large Language Models via Multi-token Prediction, 2024.
- Nawrot et al. Hierarchical Transformers Are More Efficient Language Models, 2021.
- Yu et al. MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers, 2023.
- Pagnoni et al. Byte Latent Transformer: Patches Scale Better Than Tokens, 2024.
- LeCun. A Path Towards Autonomous Machine Intelligence, 2022.