热心市民王先生

SLAI T-Rex

#论文解读 #Hugging Face #大模型训练 #昇腾 NPU

基于 Hugging Face Daily Papers 2026-07-23 榜首论文,深入解读 SLAI T-Rex 如何在昇腾 SuperPOD 上优化万亿参数 DeepSeek-V4 全参数后训练,并以求解器验证的 CPT-SFT 流程增强运筹学建模能力。

自动研究时间:2026-07-24 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Jul 23,列表最顶部为 SLAI T-Rex;详情页标注 #1 Paper of the day
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> 73 页 arXiv PDF 与完整 TeX 源码 -> 开源仓库和模型页交叉核对。

执行摘要

万亿参数 Mixture-of-Experts(MoE)模型在后训练阶段仍要保存全部参数、梯度与优化器状态,同时承受专家路由、稀疏注意力和多维并行引入的通信与调度开销。现有大规模训练经验又大多围绕 CUDA GPU 或 TPU 建立,迁移到 SIMD 架构的昇腾 NPU,问题并不等价于替换一套算子库。SLAI T-Rex 针对这一缺口,给出从并行策略、计算通信编排、内存交换到 AscendC 内核的完整优化实践。

论文实际上包含两条相连但不同的实验线。第一条使用 1.6T 参数的 DeepSeek-V4-Pro 研究系统效率:基线中通信占设备内核时间的 52.2%,稀疏注意力反向又是最大的单个计算热点;作者通过 ETP、VPP、通信覆盖、双缓冲 Swap Optimizer、AuraKernel 和算子链融合,将 MFU 提升到 34.22%,相对开源基线为 2.93 倍。第二条使用规模更小、适合实验迭代的 DeepSeek-V4-Flash 验证运筹学(Operations Research,OR)领域后训练:以求解器验证的合成语料做 CPT,再用清洗后的 10K SFT 数据对齐建模和 Gurobi 输出协议。

能力实验显示,匹配相同 SFT 数据与训练设置时,CPT+SFT 在 NL4OPT、OptiBench、B4O-Feasible 和 B4O-ORGEval 的零样本 Pass@1 分别达到 89.52、67.12、71.22 和 59.39,四项平均 71.81。相对 SFT-only,CPT 带来的最大额外增益出现在结构等价性最严格的 B4O-ORGEval,为 10.66 个百分点。这支持一个有价值的区分:SFT 更擅长让模型遵循代码、数据和求解器协议,CPT 更擅长注入变量族、约束族和数学结构等领域先验。

但这不是一次已经完整闭环的“1.6T 运筹学模型训练”。34.22% MFU 来自 Pro 系统实验,71.81% OR 得分来自 Flash 领域适配;论文明确把在 Pro 上复现完整 CPT-SFT 结果列为未来工作。部分生产数据、集群配置和评测工件未开放,优化内核也计划后续发布。因此,SLAI T-Rex 当前最强的意义是一套具有实测支撑的全栈工程路径,而不是完全可外部复现的最终训练配方。

1. 论文基本信息

项目内容
论文标题SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
论文编号arXiv:2607.20145
arXiv 版本v1,2026-07-22 提交
Hugging Face 状态2026-07-23 Daily Papers 榜首,#1 Paper of the day
作者Dongfang Li、Xiaodong Luo、Ruoyu Sun 等 65 位作者
团队AI Training Platform Team,Shenzhen Loop Area Institute
学科分类Computation and Language(cs.CL),同时归入 Artificial Intelligence(cs.AI)
系统模型DeepSeek-V4-Pro,1.6T 参数,用于 SuperPOD 训练效率验证
领域模型DeepSeek-V4-Flash,用于 OR 领域 CPT、SFT 与能力评测
论文规模73 页、22 幅图、20 张表
开放资源CPT/SFT 数据构造工具、MindSpeed-LLM 训练模板、检查点转换与评测脚手架;大规模生产输入和私有集群配置未开放

核心链接:

2. 背景与动机:为什么万亿参数后训练需要重新设计系统

2.1 MoE 节省每 token 计算,却没有消除训练复杂度

MoE 只为每个 token 激活部分专家,使计算量随总参数量次线性增长,但全参数训练仍要管理全部模型状态。DeepSeek-V4-Pro 还叠加了分层稀疏注意力和复杂残差连接,形成三类耦合压力:

  • 内存压力:1.6T 参数、梯度、优化器状态和激活无法由单卡容纳,多维并行与内存换入换出不可避免;
  • 通信压力:TP、DP、PP 和 EP 分别引入规约、点对点传输和 All-to-All,等待时间取决于调度而不只是链路带宽;
  • 内核压力:稀疏索引、共享 KV、mHC、RoPE 和 limited SwiGLU 产生大量架构特有算子与碎片化小算子,通用矩阵乘优化无法覆盖。

基线 profile 给出了问题的实际分布。通信占总设备内核时间的 52.2%,其中 TP/DP 集合通信占通信时间 48.4%,PP 点对点传输占 36.7%,EP 的 All-to-All 只占 14.5%。这意味着最显眼的 MoE 专家通信并不是首要矛盾;若只优化 All-to-All,仍会留下更大的张量/数据并行与流水线等待。

2.2 OR 领域暴露“能运行”与“建模正确”的差距

运筹学任务要求模型把自然语言需求转成变量、目标函数、约束与可执行求解器程序。一个 Gurobi 脚本能够运行并得到可行解,不代表它表达了正确的数学模型。原始 DeepSeek-V4-Flash 在 B4O-Feasible 的零样本准确率为 60.47%,但在检查变量—约束图结构等价性的 B4O-ORGEval 上只有 34.26%;相关代码构建通过率却达到 79.19%。

作者进一步扫描了 Pass@1、Pass@16 和 5-shot 设置下共 1,456 个失败样本。总体错误中,结构等价性占 28.3%,协议/API/schema 占 23.9%,离散变量语义占 12.5%,比例与非线性建模、复杂约束和单位问题也占较大比例。5-shot 能显著减少输出协议错误,却不能稳定修复整数变量、非线性重构和规范化约束图。这组诊断直接导出两阶段分工:

  • CPT 学习 OR 术语、建模范式、变量与约束结构、非线性重构等“知识与先验”;
  • SFT 学习代码输出、Gurobi API、外部数据读取和评测格式等“行为与协议”。

3. 核心贡献

3.1 SuperPOD 感知的并行与调度优化

作者没有套用固定的并行配方,而是根据 profile 选择优化目标。

首先,在每张 Ascend 910C 只有 64 GB HBM 的约束下,注意力层将 TP 从 4 降到 2,以减少集合通信并扩大稠密 GEMM;MoE 层则使用 expert-tensor parallelism(ETP)与 Parallel Folding,把 ETP 折入 EP 组,避免额外的 AllGather 和 ReduceScatter。这样,注意力和专家层不必共享同一切分粒度。

其次,PP 度为 8 时选择 Virtual Pipeline Parallelism(VPP),而非更强调双向重叠的 DualPipeV。理由不是 VPP 一般更优,而是当前瓶颈与内存预算决定的:即便使用 VPP,各 NPU 峰值预留显存已达 51.7–54.6 GB;DualPipeV 要同时保留两个模型 chunk 和更多在途激活,容易超过 64 GB。与此同时,DualPipeV 重点覆盖的 EP All-to-All 只占通信时间 14.5%,VPP 针对的流水线 bubble 更接近当前主要开销。

系统还把 shared-expert 前向计算提前到 EP 同步等待窗口中,以有用计算覆盖 token dispatch 的阻塞;并采用双缓冲 Swap Optimizer,让当前分区的 NPU 优化器计算与下一分区的 CPU-NPU 数据交换重叠。其方法论是先识别“暴露在关键路径上的等待”,再决定何种重叠有价值。

3.2 AuraKernel:从启发式调参转向求解器引导的内核代理

AuraKernel 面向复杂 AscendC 算子,工作流程分三层:

  1. OR-based tiling:把 AI Core 切分、L0/L1/UB 容量、对齐、双缓冲和 MTE/MAC/FixPipe 流水线写成约束优化问题,最小化稳态阶段的最大周期成本;
  2. 硬件闭环搜索:每个候选都经过编译、正确性门控和真实硬件 profile,搜索树可以分支、回滚并在实测提升后建立检查点;
  3. 技能沉淀:把“指标—策略—代码改写—收益”记录成可检索经验,供后续算子优化复用。

这种设计的关键不只是自动改代码,而是让求解器先诊断瓶颈究竟位于 GM/L1 搬运、L2 复用、CUBE、写回还是标量控制,减少代理在无关方向上的长程试错。

代表性结果显示,稀疏注意力前向加速 1.09–1.23 倍,反向加速 1.21–1.24 倍,lightning indexer 反向加速 1.16–1.21 倍。数值看似不如某些微基准惊艳,但这些是训练 profile 中占比最高的算子,且优化集中在真实的 MTE2/MTE3 搬运和标量寻址瓶颈。对 14 个 Triton-Ascend 算子的优化任务,平均加速 2.06 倍;无权重 RMSNorm 前向最高达到 11.90 倍,反向为 3.42 倍。

3.3 算子链融合:处理碎片化的“长尾税”

单步 profile 包含 206,503 个计算内核。非矩阵乘 eager 算子占 91.3% 的调用,却只占 66.7% 的时长;58.0% 的调用短于 20 微秒,合计只完成 2.2% 的有效设备工作。问题不是每个小算子本身特别慢,而是反复付出 launch、物化中间张量、dtype 转换和全局内存往返。

作者将 mHC pre/post-projection、limited SwiGLU 和 RoPE 的 Python/autograd 算子链改写为保持中间结果驻留 UB 的 AscendC 内核。模块级结果包括:

融合目标模块耗时变化加速
mHC pre-projection1.287 s -> 0.425 s3.03 倍
mHC pre-projection backward1.913 s -> 1.019 s1.88 倍
mHC post-projection1.710 s -> 0.624 s2.74 倍
Limited SwiGLU forward1.480 s -> 0.167 s8.86 倍
Limited SwiGLU backward0.805 s -> 0.246 s3.27 倍
RoPE forward sites1.421 s -> 0.611 s2.33 倍
RoPE backward sites1.599 s -> 0.451 s3.54 倍

AuraKernel 与算子链融合针对不同区域:前者优化已经是大执行单元的热点内核,后者改变碎片化计算的执行边界。二者共同构成从 heavy head 到 long tail 的覆盖。

3.4 求解器验证的 OR-CPT 数据引擎

OR-CPT Data Engine 从参数化优化问题生成器出发,覆盖指派、调度、设施选址、网络流、生产计划、路径、运输、投资组合等任务族。每个实例先由 Gurobi 独立执行,得到状态、目标值、变量赋值和约束诊断,并过滤不可行、全零、重复或缺乏有效权衡的样本。

然后系统把结构化实例渲染成业务自然语言问题,再要求模型仅根据问题重建变量、目标、约束和可执行代码。重建结果必须同时通过:

  • 任务族契约,例如设施开启变量必须约束分配变量,网络流必须包含流量守恒;
  • 静态格式和泄漏检查;
  • 独立 Gurobi 执行;
  • 与原始参考目标值在容差内一致。

这形成“结构化实例 -> 自然语言 -> 可执行模型”的双向验证链。CPT 语料再混合约 100K 条 OR 资源池、数学文本、科学代码和通用英文数据。后续消融显示,纯 OR CPT 会让通用 benchmark 下降 10–15 分,却没有提高 OR Overall;论文采用约 75% OR 加保留通用语料的平衡方案,说明领域适配不是把通用数据全部挤出去。

3.5 自蒸馏 SFT 与多级质量门

SFT 数据使用三种问题表示:数据直接写入问题(DP)、表格数据(DT)和问题—数据文件分离(DPS)。管线以三层中间表示控制合成:

  • L1 Canonical IR 记录输入契约、文件状态、风险和代码特征;
  • L2 Semantic IR 抽取集合、参数、变量、目标与约束;
  • L3 Synthetic IR 改变领域、实体、目标语义、变量族、约束族和数值结构,避免复制种子或评测样本。

作者先比较 3K、10K、50K 自蒸馏数据,发现规模并非单调有益:50K 的 OptiBench 从基座 63.33 降到 58.68,说明更多弱验证样本会放大基座模型偏差。团队因此回到 10K 数据做 contract-aware cleaning,并设计 Cleaner、独立 Reviewer、代码执行 Validator 和失败诊断 Resolver。Clean-CoT 的 10,000 个候选中,9,174 个通过 Reviewer,最终 8,881 个通过执行验证并导出。

Clean-CoT 不追求更长的自由推理,而是在允许解释的任务中加入简短建模检查清单:变量类型、目标方向、关键约束、比例或非线性形式、Gurobi 执行动作。代码-only 任务仍保持严格输出契约。

4. 实验结果

4.1 系统效率:34.22% MFU 的含义

完整系统在 DeepSeek-V4-Pro 上达到 34.22% Model FLOPs Utilization,相对开源基线配方提升 2.93 倍,同时保持训练稳定。这个结果证明昇腾 SuperPOD 能承载复杂的万亿参数 MoE 全参数后训练,也说明性能来自分层组合,而不是单个“神奇内核”。

不过,论文没有给出所有系统组件对最终 MFU 的统一逐项消融,也没有与同模型、同规模 GPU 集群做成本、能耗和 wall-clock 的等预算对照。因此可以确认的是“相对该昇腾开源基线显著提速”,不能据此推导其绝对性价比优于其他硬件平台。

4.2 数据规模与清洗:质量优先于继续堆量

模型NL4OPTOptiBenchB4O-FeasibleB4O-ORGEval
DeepSeek-V4-Flash84.0863.3360.4734.26
SFT-3K80.6260.6664.5143.65
SFT-10K81.6662.6765.0747.21
SFT-50K82.0158.6864.9745.94
SFT-Clean-CoT86.9364.1765.9348.73

未经清洗的 SFT 已明显改善两个 B4O 任务,却伤害 NL4OPT 和 OptiBench;50K 也没有压倒 10K。Clean-CoT 相对 SFT-10K 将四项分别提高 5.27、1.50、0.86 和 1.52 个百分点,说明错误修复与协议门控比继续扩大同质自蒸馏数据更有效。

局限同样清晰:清洗后 OptiBench 的粗粒度目标/模型错误减少,但 nonlinear 或 bad Gurobi form 错误从 49 增到 56。短检查清单能帮助模型判断“要建什么模型”,还不能稳定解决“怎样把比例、平均值、二次项合法写进求解器”。

4.3 匹配条件下,CPT 的增益集中在结构推理

直接 SFT 与 CPT+SFT 使用同一批 10K Clean-CoT 数据、220 次 SFT 迭代、全局 batch size 128、序列长度 8,192 和峰值学习率 5e-6。因此可以较干净地观察 CPT 初始化的贡献。

模型NL4OPTOptiBenchB4O-FeasibleB4O-ORGEval
DeepSeek-V4-Flash84.0863.3360.4734.26
SFT-Clean-CoT86.9364.1765.9348.73
CPT+SFT-Clean-CoT89.5267.1271.2259.39
CPT 相对 SFT 增益+2.59+2.95+5.29+10.66

B4O-ORGEval 不只检查代码是否执行,而是把公式规范化成变量—约束图,用 Weisfeiler-Lehman reward 评估结构匹配。CPT 在该项带来最大额外增益,符合“领域语料注入数学结构先验”的机制解释;如果提升只来自记住 Gurobi 语法,增益更应主要集中在 Feasible。

4.4 与其他模型比较:平均第一不等于每项第一

SLAI T-Rex 的四项零样本 Pass@1 平均为 71.81,高于 GPT-5.4-Mini 的 67.83 和 Gemini-3-Flash 的 66.82。它在 NL4OPT 与 B4O-ORGEval 第一,OptiBench 第二;B4O-Feasible 为 71.22,低于 GPT-5.4-Mini 的 73.84、Kimi-K2.6 的 72.67 和 Gemini-3-Flash 的 71.80。

更重要的是,CPT+SFT 并非在所有解码设置都占优。B4O-Feasible 的 5-shot Pass@1 为 74.78,仍低于基座模型 78.20;SFT-only 更降到 73.55。论文如实报告了这一反例,说明领域后训练提高零样本可靠性,却可能改变 few-shot 条件下原有的行为分布。

在通用能力上,SLAI T-Rex 相对基座在 MMLU、CMMLU 和 GSM8K 分别为 +0.9、+0.3、+0.5,但在 MMLU-Pro、HumanEval 和 MATH 分别为 -1.8、-0.6、-1.7。结果没有显示灾难性遗忘,但“通用能力完全无损”也并不准确,更合适的结论是小幅、有正有负的波动。

5. 如何理解这篇论文的真正创新

5.1 两条闭环使用了同一种思想:先测瓶颈,再改变训练分布

系统侧先用 profile 确定等待来自哪里,再决定降低 TP、采用 VPP、融合算子还是重写内核;数据侧先用 benchmark 与失败样本确定模型缺失何种知识,再决定 CPT、SFT、清洗和验证的分工。两者都反对仅凭经验堆叠通用方案。

这种“诊断驱动的后训练”比某个具体配方更可迁移。不同硬件的主要通信可能不同,不同垂直领域的主要错误也不同;真正稳定的流程应当让 profile 与评测决定优化预算。

5.2 可执行验证是垂直领域数据的核心基础设施

OR 的优势在于答案可以由求解器部分验证。SLAI T-Rex 没有把语言模型评分当成数学正确性的代理,而是把生成器契约、静态规则、独立执行、目标值比对和 Reviewer 组合成质量门。这个思路可推广到代码、形式化证明、SQL、芯片设计等拥有外部验证器的领域。

但求解器返回 optimal 也不是充分条件。一个错误模型仍可能被成功求解,这正是 ORGEval 与结构契约存在的原因。可靠合成数据需要同时验证“程序能跑”“数值合理”和“结构表达了原问题”。

5.3 领域能力不是 CPT 或 SFT 的单选题

论文的 matched transfer 实验给出了较强证据:SFT 让输出协议迅速可用,CPT 则在结构等价性上提供更大增益。对复杂垂直领域,知识注入、行为对齐和外部验证应该是连续链条,而不是用一批 instruction data 同时承担所有任务。

6. 局限与审慎解读

6.1 Pro 的系统结论与 Flash 的能力结论尚未合流

论文最容易被误读之处,是把所有数字归于同一个模型。1.6T DeepSeek-V4-Pro 用于系统 profile 和 MFU 优化;OR CPT-SFT、10K 数据实验和 benchmark 结果来自 DeepSeek-V4-Flash。作者尚未报告在 Pro 上完成同样的 OR 领域后训练,因此论文证明了基础设施可扩展性和 Flash 领域适配的有效性,却未实证二者在最大模型上的端到端合流。

6.2 复现开放度仍有限

仓库公开了数据构造、训练脚本模板、检查点转换和评测流程,但明确排除了大规模生产输入、私有集群配置和专有评测工件。CPT 资源池只给出约 100K 的库存量,精确抽样比例被视为配方参数;AuraKernel 优化得到的 AscendC 内核也被列为计划后续单独发布。

因此,外部团队目前能够审计方法和运行部分脚手架,却难以复现 34.22% MFU 或完全相同的 71.81% 能力结果。论文所称“full reproducibility”更接近工件发布目标,而不是当前已经满足的状态。

6.3 系统比较缺少等预算外部基线

2.93 倍来自同一昇腾环境中的开源基线,不是与 GPU 或 TPU 集群的直接比较。论文没有统一报告端到端 tokens/s、总训练时间、功耗、硬件数量、故障率和成本,也没有给出每个系统组件对最终 MFU 的完整消融。对采购或平台选型而言,证据还不足以支撑跨硬件总体拥有成本判断。

6.4 领域评测范围仍窄

四个 OR benchmark 主要覆盖自然语言建模、Gurobi 可执行性和 LP 图结构。真实工业系统还需要处理脏数据、动态约束、多目标、鲁棒/随机优化、超时、不可行诊断以及模型维护。作者也承认比例约束、二次项、非线性表达和 Gurobi 特定模式仍是薄弱点。

此外,部分合成语料和评测共享宽泛的 OR 问题族。论文强调不复用 ORGEval 模板、参考图或实例 provenance,并设置语义与 IR 级泄漏检查,但在外部无法访问全部生产数据的情况下,仍难独立审计分布重叠程度。

7. 应用影响

7.1 国产算力上的前沿模型后训练

这项工作表明,昇腾 SuperPOD 不只适合推理或小规模微调,也能通过架构感知的并行、内存和内核优化支撑万亿参数 MoE 全参数训练。对需要自主训练栈的机构,它提供了比“API 兼容”更细的迁移清单:通信分解、流水线选择、host-device tiling 契约、内存换入换出和模型特有算子都必须共同设计。

7.2 供应链、排产与资源配置助手

领域模型在自然语言到数学规划、Gurobi 代码生成和结构等价性上明显增强,可用于建模草稿、约束检查、模板检索和求解器程序生成。近期更合理的产品形态是“OR 工程师副驾”,由人审核变量、约束和目标,而不是自动接管生产决策。

7.3 可验证数据工厂

双向合成、求解器执行与多级质量门可成为企业内部数据建设模板。组织可以从已有优化模型、业务 schema 和求解日志出发,生成多种自然语言场景,再反向验证模型是否恢复正确结构。相比仅由大模型互评,这种流程更适合高准确率要求的专业领域。

7.4 内核优化代理

AuraKernel 把 OR 求解、真实硬件 profile、可回滚搜索和经验沉淀结合起来,展示了 AI for Systems 的实用途径。其价值不仅在 AscendC;任何具有明确存储层次、并行限制和可测性能计数器的加速器,都可能采用相似的“模型约束先验 + 实机反馈”优化方式。

8. 与相关工作的关系

路线代表方向SLAI T-Rex 的位置
大规模 MoE 训练Megatron-LM、DeepSpeed、DeepSeek、Kimi、GLM 的 GPU/TPU 训练系统转向 Ascend SIMD NPU,强调 SuperPOD 上的并行、调度和内核协同
流水线与专家并行1F1B、VPP、DualPipeV、Parallel Folding不追求固定“最佳”调度,而是根据通信占比和 64 GB HBM 选择 VPP 与 ETP folding
自动内核优化Triton、TVM、CUDA kernel agents、AscendKernelGen/AscendCraft 类工作在 AscendC host-kernel 双端约束下加入 OR tiling 和真实 profile 闭环
领域继续预训练Domain-Adaptive Pretraining、CPT 后接 instruction tuning以 matched SFT 对照量化 CPT 对结构先验的额外价值
LLM for Operations ResearchOptiMUS、ORLM、OptiBench、NL4OPT、Text2Opt从 agent 或提示系统推进到全参数 CPT-SFT,并以 Gurobi 和 ORGEval 做双重验证
合成数据与自蒸馏rejection sampling、self-distillation、LLM-as-judge强调数据规模不单调有效,以 Cleaner、Reviewer、执行器和 IR 泄漏检查控制质量

论文没有单独展开正式的 Related Work 章节,相关工作主要散落在引言、方法和参考文献中。这在 73 页技术报告里略显遗憾:系统优化、内核代理和 OR 训练三条研究线都很庞大,更系统的对照会帮助读者判断哪些组件是首次提出、哪些是对既有方法的昇腾适配与组合。

9. 结论

SLAI T-Rex 的主要贡献不是一个新的损失函数,而是把万亿参数后训练拆成可以测量和验证的全栈问题。系统侧,它在 DeepSeek-V4-Pro 上识别通信、稀疏内核和碎片化算子三类瓶颈,并用并行编排、AuraKernel 与算子融合把 MFU 提升到 34.22%。能力侧,它在 DeepSeek-V4-Flash 上用求解器验证 CPT 语料、清洗后的 10K SFT 和匹配条件实验,证明 CPT 与 SFT 对结构知识和输出协议具有互补作用。

最稳健的三个结论是:昇腾 SuperPOD 可以承载复杂万亿参数 MoE 的稳定全参数后训练;对 OR 领域,自蒸馏数据质量比简单从 10K 扩到 50K 更重要;CPT 在结构等价性上提供了 SFT 难以替代的额外增益。

同时,Pro 与 Flash 两条实验线尚未端到端合流,关键生产工件与优化内核也未完全开放。后续最值得关注的不是再增加一个 benchmark,而是作者能否在 DeepSeek-V4-Pro 上复现完整 OR 后训练、公开可验证的系统消融与成本指标,并让外部团队从数据构造到内核优化真正复现主要结果。

参考资料

  1. Li et al. SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD. arXiv:2607.20145, 2026.
  2. Hugging Face. SLAI T-Rex Daily Papers 详情页.
  3. SLAI-AITP. SLAI T-Rex 开源仓库.
  4. SLAI-AITP. DeepSeek-V4-Flash-OR 模型页.
  5. Shoeybi et al. Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.
  6. Gururangan et al. Don’t Stop Pretraining: Adapt Language Models to Domains and Tasks.
  7. Ramamonjison et al. NL4Opt Competition: Formulating Optimization Problems Based on Their Natural Language Descriptions.
  8. Huang et al. ORLM: A Customizable Framework in Training Large Models for Automated Optimization Modeling.