本页目录 Compile by Training

Compile by Training

深入解析 Compile by Training 如何让教师模型合成监督数据,以 PAW 预测为热启动,在共享 Qwen3-0.6B 解释器上训练 LoRA 神经函数;复核 FuzzyBench-Hard 的 83.6% 语义准确率、约一分钟编译延迟,以及本地执行、组合部署、教师偏差和评测外推边界。

自动研究时间:2026-09-06 09:03(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 4,列表最顶部为 Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv HTML 全文与 10 页 PDF(含实验附录和提示词)-> 官方代码与演示页面。

执行摘要

Compile by Training 试图把一类夹在“手写规则”和“每次调用大模型”之间的任务变成可复用软件资产:开发者只写自然语言规格,编译服务用教师模型合成输入—输出样本,再在冻结的 Qwen3-0.6B 解释器上训练一个任务专属 LoRA adapter。编译完成后的 .paw 文件带着 adapter、运行时 scaffold、原始规格和解释器元数据,可以保存、版本化、组合,并在后续调用时脱离教师模型本地执行。

它不是从零开始微调。系统先用 Program-as-Weights(PAW)的摊销编译器在数秒内预测初始 adapter 与 scaffold,再用合成数据继续优化。这相当于把 PAW 的“单次前向预测权重”作为热启动,用约一分钟的额外编译计算换正确率。作者专门构造了 PAW 快速编译器没有任何 exact match 的 FuzzyBench-Hard;按 GPT-5.5 语义裁判给出的 LLM Exact Match(LEM),快速编译器仍有 22.4% 的语义正确率,而 Compile by Training 达到 83.6%,绝对提高 61.2 个百分点。代表性冷编译在 B300、H200 和 RTX GPU 上分别耗时 50.9、68.2 和 99.2 秒,快速编译器为 3.5 秒。

这项工作的真正价值不是“小模型全面替代大模型”,而是改变成本发生的位置:教师和 GPU 成为编译期依赖,重复推理变成共享 0.6B 模型加小型 adapter 的本地执行。对高频、边界相对稳定、允许以统计正确率实现的 text-to-text 函数,这可能显著降低远程调用成本、延迟和供应商依赖;对于低频任务、快速变化的规格、必须保证正确的决策,合成数据覆盖、重新编译、验证和本地模型运维可能反而更贵。

证据也有明显边界。核心正确率来自一个按基线失败筛出的困难子集,论文没有给出本文可见版本中的任务规模、逐任务方差或置信区间;LEM 又依赖 GPT-5.5 裁判,尽管其在 128 个人工标签上达到 97.7% 准确率和 0.946 Cohen’s kappa,仍不能替代确定性测试。应用部分主要是系统演示,只有 Avatar Director 报告 44 条手写验证指令中的 43 条结构正确;网站助手和 Claudish 翻译器的流量说明系统能运行,却不等于质量、鲁棒性或真实用户收益已经得到严格验证。

1. 论文基本信息

项目内容
论文标题Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
论文编号arXiv:2609.04199
当前版本v1,2026-09-03 提交,10 页
作者Yuntian Deng、Pengyu Nie、Stuart Shieber
机构University of Waterloo、Harvard University
投稿说明EMNLP 2026 System Demonstrations
学科Computation and Language(cs.CL);Artificial Intelligence(cs.AI);Machine Learning(cs.LG)
核心系统Compile by Training、Program-as-Weights(PAW)
共享解释器Qwen3-0.6B,量化本地运行时
任务专属参数LoRA rank 64、alpha 16,加运行时 scaffold
核心评测FuzzyBench-Hard、LLM Exact Match(LEM)
主要结果LEM 22.4% -> 83.6%;代表性 B300 冷编译 50.9 秒

核心链接:

2. 背景与动机:为什么把自然语言规格“编译”成权重

2.1 规则系统与远程大模型之间的空档

论文用邮件分流说明问题:Signature needed by EOD 应归类为 immediate,普通 newsletter 则归类为 wait。需求很容易用自然语言讲清楚,却可能包含大量语义边界,难以写成稳定的 if-else 或正则表达式。

直接调用通用大模型可以处理这类模糊函数,但每个输入都要重新承担:

  • 网络往返与服务可用性风险;
  • 按 token 或请求计费的重复成本;
  • 数据发送给外部提供商的治理负担;
  • 模型升级、限流和接口变化带来的供应商依赖。

如果函数会被调用成千上万次,把大模型从“每次执行者”改成“一次性工具构建者”就有经济意义。Compile by Training 因此把 adaptation 视为软件 build step:先投资一次教师合成和梯度优化,再反复调用产物。

2.2 PAW 已经能秒级编译,为什么还要训练

Program-as-Weights 把每个模糊函数表示为共享解释器上的一组神经程序权重。其快速编译器读取自然语言规格,通过一次前向传播直接预测 adapter,数秒内就能生成 .paw 程序。

这种摊销方式的约束是:不管任务简单还是困难,编译计算量基本固定。它擅长快速给出一个近似程序,却无法针对某项规格持续检查并修正边界。Compile by Training 没有放弃这一快速预测,而是把它当作 initialization,再为困难任务支付更多计算预算。

由此形成同一接口下的两档产品:

编译方式初始产物额外监督代表性耗时适合场景
PAW fast compiler单次前向预测 adapter 与 scaffold无任务专属合成训练3.5 秒原型、低风险任务、快速反馈
Compile by TrainingPAW 预测作为热启动教师合成数据 + LoRA 优化约 1 分钟高频、较难、值得摊销编译成本的函数

2.3 “本地函数”的准确含义

论文所谓 local,指的是编译完成后的运行阶段。后续输入由本地 SDK、共享解释器和下载的 adapter 处理,不再发给 PAW 服务或教师模型。

编译本身仍是托管流程:自然语言规格会发送给 PAW 服务和教师 API,训练依赖 GPU worker。因而它减少的是运行时外部依赖,并未实现端到端离线编译。若规格本身包含敏感业务规则,编译期数据治理仍需单独评估。

3. 核心贡献

3.1 从规格直接生成可复用神经函数

系统把接口抽象为两步:

  1. compile(spec) -> program:自然语言规格生成神经程序;
  2. run(program, input) -> output:程序在新输入上重复执行。

这使模型适配产物获得普通软件的一些属性:可保存、缓存、版本化、下载和组合。.paw artifact 不只是裸 LoRA,还包含原始规格、编译生成的运行时 prompt scaffold 以及解释器元数据,SDK 据此重建函数行为。

3.2 用“摊销预测 + 规格专属训练”连接速度与准确率

传统微调从基座模型开始,每个任务都要重新寻找合适参数;PAW 快速编译器直接预测权重,但难以增加单项任务的思考预算。本论文把二者串联:

自然语言规格
  -> PAW 摊销编译器预测初始 adapter 与 scaffold
  -> 教师模型并行合成任务样本
  -> 用合成样本继续训练 LoRA
  -> 打包为可复用 .paw 程序
  -> 共享 Qwen3-0.6B 解释器本地执行

这一设计把快速编译器变成 learned optimizer 的 warm start。理论上的收益是减少从随机或通用初始化出发的训练步数,同时保留按任务追加计算的能力。

3.3 为分钟级编译设计可交互服务

论文不仅给出训练方法,也处理如何把 50–100 秒的任务包装为可用产品:

  • 教师请求、解释器加载与训练并发启动;
  • 第一批所需样本到达后立即训练,不等待全部合成结束;
  • 优先用到达的样本填补较早 batch 的空位,同时保持规定训练顺序;
  • API 持久化 job,队列把任务分发给 GPU workers;
  • worker 在请求教师前检查缓存,复用匹配的合成结果;
  • 完成 artifact 写入共享存储,并通过同一 job record 返回;
  • 页面跳转或刷新不丢失队列位置与训练进度。

这部分贡献很工程化:一分钟不算“实时”,但可以成为用户可理解、可离开页面、可恢复查看的后台 build。

3.4 展示神经函数与确定性软件的组合方式

论文的三个应用都没有让神经函数接管完整系统。它们把模糊判断交给 adapter,把检索、缓存、路由控制、DSL 解析和执行留给普通代码。这种边界比“端到端 Agent 处理一切”更值得关注,因为它为校验和故障隔离留下了明确接口。

4. 方法详解

4.1 阶段一:从自由文本规格生成监督数据

单条规格不能直接支撑梯度训练,因此教师模型为规格生成多样的 (input, output) 对。教师输出必须是带 examples 顶层字段的严格 JSON,每个样本包含字符串类型的 inputoutput。编译器校验响应,拒绝格式错误或内容不完整的 batch。

公共服务混合两类教师:GPT-5.4-mini 负责大多数样本,GPT-5.5 提供互补监督,数量比例为 2:1。论文示例要求函数从 /pdf/ 链接中提取 arXiv ID、忽略 /abs/ 链接,教师据此构造包含正例、干扰项和目标 JSON 输出的样本。

这里的核心假设是:自然语言规格足够明确,教师能把它展开成覆盖真实输入分布的训练集。若规格遗漏边界,多个教师可能一致地合成“看似合理但并非用户想要”的数据,后续训练只会更稳定地固化这一偏差。

4.2 阶段二:专门化共享解释器

所有函数共用冻结的 Qwen3-0.6B;每项函数只训练轻量 LoRA,并配一个把自由文本规格整理为结构化任务说明、示例与运行时输入占位符的 scaffold。这样避免为每项规格复制完整模型。

公共 Finetuned Standard 配置如下:

配置项论文公开值
InterpreterQwen3-0.6B,量化本地运行时
TeachersGPT-5.4-mini 与 GPT-5.5,2:1 混合
数据2,400 个 unique pairs,扩展为 6,400 个训练样本
优化batch 48,100 steps,cosine learning-rate decay
AdapterLoRA rank 64,alpha 16
初始化PAW hypernetwork / amortized compiler 预测
执行调度shuffled batches,教师合成与训练重叠

这里的“2,400 扩展到 6,400”意味着部分样本会重复进入训练。重复可以把固定步数填满,但它不等同于获得更多输入多样性;后文 data-scaling sweep 也显示 unique pair 数量仍会影响结果。

4.3 阶段三:打包和运行

训练结束后,系统将 LoRA、scaffold、原规格和解释器信息打包成 .paw。运行时,SDK 把新输入填入 scaffold,并让共享解释器加载对应 adapter 生成输出。

多个函数可以共用同一 0.6B 基座,因此新增函数的主要存储成本来自 adapter,而不是完整模型副本。不过论文没有在当前版本量化 adapter 文件大小、切换 adapter 的吞吐损失、并发隔离和不同硬件上的本地推理性能,这些都直接影响大规模部署经济性。

5. 实验设计与指标

5.1 为什么不用字符串 exact match

模糊函数可能有多个等价答案。例如 JSON key 顺序、空格或列表包装形式不同,字符串比较会误判。作者使用 LLM Exact Match(LEM):给裁判模型提供规格、输入、reference output 和 model output,要求根据规格判断语义是否正确。

裁判 prompt 明确区分:

  • 可以忽略的差异:空白、未被规格固定的 JSON 排版和 key 顺序、bullet 样式、不改变含义的尾随标点;
  • 不可忽略的差异:值错、缺项、多项、必须有序时顺序错误、标量与数组等结构错误、不当拒答;
  • 若规格明确固定格式,必须严格执行该格式;
  • 不确定时默认判错。

5.2 LEM 裁判本身如何验证

裁判人工标注样本AccuracyFPRFNRCohen’s kappa
GPT-5.51280.9770.0250.0230.946
GPT-5.4-mini1280.9380.0500.0680.858

作者选择 GPT-5.5。97.7% accuracy 与较高 kappa 说明它和作者标签高度一致,但 128 条样本仍然有限,而且作者没有报告标签来源、类别比例、盲评协议和多名人工标注者之间的一致性。LEM 适合补充 exact match,却不应被理解为无误差的自动真值。

5.3 FuzzyBench-Hard 的构造

FuzzyBench-Hard 取自 PAW 使用的 FuzzyBench,筛选条件是:PAW 快速编译器在相关规格上没有产生任何字符串 exact match。这个切片故意聚焦快速方法的失败区。

需要注意两点:

  1. “没有 exact match”不等于完全错误,PAW fast 在 LEM 下仍有 22.4%;
  2. 按基线失败筛选后,不能把结果直接外推为整个 FuzzyBench 的平均提升,更不能证明简单任务也值得付出一分钟编译成本。

6. 核心实验结果

6.1 训练能否改善正确率

方法FuzzyBench-Hard LEM编译时间相对定位
PAW fast compiler22.4%3.5 秒秒级近似编译
Compile by Training83.6%50.9 秒(B300 代表性冷编译)分钟级高准确率编译
变化+61.2 个百分点约 14.5 倍用编译计算换正确率

这是论文最有力的结果:同一 PAW 程序格式和运行接口下,追加合成监督与优化显著改善了困难切片的语义正确率。它证明“快速预测权重之后继续训练”有价值,但没有分离以下因素各自贡献:更多 teacher tokens、不同教师混合、更多 unique pairs、PAW 热启动、LoRA 超参数和 100 步训练。

6.2 教师混合与数据规模

论文报告两组已有 sweep:

Sweep设置Mean LEM
Teacher mixGPT-5.4-mini only,3,600/00.746
Teacher mix2:1 mini/GPT-5.5,2,400/1,2000.851
Data scaling1,440 unique pairs0.821
Data scaling2,400 unique pairs0.836
Data scaling3,600 unique pairs0.836
Data scaling7,200 unique pairs0.866

Teacher mix 的 10.5 个百分点提升支持“较强教师补充长尾监督”的解释。数据规模则不是平滑单调曲线:2,400 到 3,600 没有提升,翻到 7,200 才从 0.836 增至 0.866,说明新增样本质量、覆盖和训练预算可能比数量本身更重要。

两类 sweep 不能横向拼成同一消融。附录说明 teacher-mixture sweep 使用 3,600 unique pairs 重复成 6,400、batch 64;data-scaling sweep 使用 batch 48。论文也没有报告多随机种子、误差条或合成成本,所以 0.836 的平台期究竟来自统计波动、数据冗余还是优化步数限制,当前证据无法区分。

6.3 编译延迟与服务负载

硬件同一代表性规格的冷编译时间
NVIDIA B30050.9 秒
NVIDIA H20068.2 秒
RTX GPU99.2 秒

四个任务并发的负载测试中,平均排队等待为 1.01 秒,worker 利用分布均匀。由于教师合成比单步训练更慢且方差更大,合成—训练流水线减少了 GPU 等待时间。

但这是 4-job 小规模演示,不是容量规划。论文没有给出 teacher API 延迟分布、缓存命中率、GPU 数量、端到端 p50/p95、失败重试、单位编译成本或更高并发下的饱和曲线。因此可以判断“分钟级交互可实现”,还不能判断公开服务在生产负载下的成本与 SLA。

7. 应用与系统影响

7.1 Paw-helper:30 个程序构成网站助手

Paw-helper 的一个 backend 服务四个网站,内容包包含 30 个编译程序,其中 28 个参与实时路由,另 2 个用于评估和向后兼容。用户问题只通过程序树的一小部分:编译函数判断需要链接还是文本回答、基于页面或检索结果生成回答、选择或合并候选;BM25 检索、缓存和分支控制仍由确定性代码负责。

这一案例说明 adapter 不必承担完整对话 Agent 的所有能力。把每个模糊决策压缩成窄函数,可以分别版本化和替换,也能在程序树上观察错误发生在哪一层。不过论文没有给出 Paw-helper 的端到端准确率、延迟、人工满意度或与单次大模型调用的成本对照。

7.2 Avatar Director:自然语言生成受控 DSL

Avatar Director 把“jump twice, then dance”之类指令变成小型动作 DSL。神经函数负责将自由语言映射到序列、持续时间、重复和兼容并行动作;浏览器中的确定性解析器先验证 DSL,再驱动 3D 角色。

44 条人工编写的验证指令中,43 条得到预期动作结构,即 97.7%。样本很小且可能接近作者设想的正常表达,不能说明对对抗提示、冲突动作、超长指令和域外语言同样可靠,但“生成受限中间表示,再由传统程序验证执行”是比直接生成浏览器动作更安全的架构。

7.3 English–Claudish:共享解释器上的双向 adapter

作者为 English-to-Claudish 和 Claudish-to-English 分别写规格、分别编译一个 adapter,共用同一 0.6B 解释器。前者保留语义并采用特定词汇、复合词和修辞结构;后者去除重复对比和结构隐喻,改写成直接英语。

从 2026-08-22 上线到 2026-09-02,演示完成 100,747 次成功翻译请求。这证明 artifact 能支撑真实在线调用量,但“successful”只表示请求成功完成,并非翻译语义正确。论文没有人工质量评测、风格偏好测试或与 prompt-only 大模型、规则改写器的对照。

7.4 哪些业务更适合

场景属性适配程度原因
高频、输入短、边界较稳定一次编译成本可由大量本地调用摊销
需要低延迟、离线或减少运行时数据外发编译后调用不依赖教师和 PAW 服务
可以用 schema、规则或人工抽检验证输出能为统计模型加确定性护栏
规格每天变化或函数调用很少重新合成与训练可能得不偿失
医疗、金融审批、安全控制等必须保证正确83.6% benchmark 语义正确率不构成保证
输入分布难以描述、长尾代价极高教师只会覆盖其从规格推断出的分布

8. 局限与风险

8.1 教师错误会被蒸馏为稳定错误

论文明确承认 synthetic supervision 会继承 teacher errors。更具体地说,风险不仅是单个标签错,还包括:

  • 教师没有想到真实环境中的长尾输入;
  • 规格有歧义,教师选择了与用户不同的解释;
  • 混合教师在格式或策略上冲突;
  • 重复样本放大系统性偏差;
  • 小解释器容量不足,只学到训练分布表面模式。

训练让输出更一致,但“一致地错”比偶尔暴露不确定性更难发现。生产系统应保留 golden tests、schema validator、拒答/回退策略和域外检测,而不能只看编译 job 成功。

8.2 基准选择有意偏向“快速编译失败区”

FuzzyBench-Hard 是一个合理的 stress test,却不适合单独回答总体性问题。当前结果无法告诉我们:

  • Compile by Training 在完整 FuzzyBench 上的平均水平;
  • 它是否让原本简单、已正确的任务退步;
  • 每项规格的收益分布和最坏情况;
  • 83.6% 是否在新教师版本、不同随机种子和不同解释器上稳定复现。

更完整的评测应同时报告全量基准、困难切片、基线成功切片,以及按任务 bootstrap 的置信区间。

8.3 LLM 裁判可能与训练教师共享偏好

监督数据来自 GPT 系列教师,语义裁判也是 GPT-5.5。即使 grader 看的是独立输出,这种同族模型组合仍可能共享格式、措辞和任务解释偏好。作者的人类标签验证降低了担忧,但样本量小,且没有报告按任务类别的错误。

对可执行输出,最好补充 parser、property test 和真实执行结果;对分类与抽取,补充人工盲评和确定性字段检查;对开放生成,则需要多裁判或用户研究。

8.4 成本比较缺少完整账本

论文给出了时间,却没有给出:教师生成 token、API 费用、GPU 分钟成本、缓存命中、adapter 存储、运行时吞吐和盈亏平衡调用次数。因而“避免每次远程调用”是架构事实,“总成本更低”则仍是依赖工作负载的推论。

一个部署决策至少应计算:

Nbreakeven=Ccompile+Cvalidation+CmaintenanceCremote per callClocal per callN_{break-even} = \frac{C_{compile} + C_{validation} + C_{maintenance}} {C_{remote\ per\ call} - C_{local\ per\ call}}

如果分母很小、规格频繁变更或验证成本很高,盈亏平衡点可能永远达不到。

8.5 本地执行并不自动等于安全

下载的程序仍是生成模型组件,可能泄露训练模式、产生不符合 schema 的输出或被 prompt injection 影响。.paw artifact 还携带原始规格,分发和日志策略应考虑规格机密性。作者建议需要保证正确的应用验证输出或保留 deterministic control path;这是必要条件,不是可选优化。

9. 与相关工作的关系

9.1 与 Self-Instruct 和知识蒸馏

Self-Instruct、Stanford Alpaca 等工作用大模型生成 instruction-following 数据,经典 knowledge distillation 让小模型模仿大教师。Compile by Training 的差异在粒度:它不是构建一个覆盖大量任务的通用学生,而是为一个用户定义函数生成数据并训练一个小 adapter。

这使产物更容易命名、版本化和组合,也意味着每个函数都要承担独立的合成与验证成本。

9.2 与 LoRA、Adapter、Prompt Tuning 和 QLoRA

LoRA、Adapter、Prefix/Prompt Tuning、QLoRA、AdaLoRA 都通过只更新少量参数降低适配成本。本论文没有提出新的 PEFT 算法,而是把 rank-64 LoRA 放进“自然语言规格 -> 合成监督 -> 可下载函数”的编译系统中。

因此创新重点在编译抽象、PAW 热启动和交互服务,而非 LoRA 数学本身。

9.3 与 Prompt2Model 和 LoRA Land

Prompt2Model 从任务描述生成可部署模型的训练流程;LoRA Land 在共享基座上服务大量任务专属 LoRA。Compile by Training 同时接近两者:前端用自然语言定义任务,后端让许多 adapter 共享冻结解释器。

其进一步主张是把 adapter 加 scaffold 包装成像普通函数一样调用的 versioned program,并用摊销编译器预测规格专属初始化。论文尚未与 Prompt2Model 做同任务、同预算的直接实验比较,因此只能确认概念差异,不能宣称效果优于这些系统。

9.4 与 Program-as-Weights

PAW 是最直接的基础工作:两者产出相同类型的神经程序,也共享本地解释器和 SDK。区别不是“是否编译”,而是编译预算:

  • PAW fast compiler 把跨任务学到的编译能力摊销为一次前向传播;
  • Compile by Training 在该预测上追加规格专属监督和梯度下降;
  • 两者组成速度—准确率曲线上的不同工作点,而不是互相替代。

10. 工程落地建议

10.1 先证明函数值得编译

上线前应记录远程基线的调用频率、p50/p95 延迟、单次费用、隐私约束和错误代价。只有当函数稳定且复用次数足够时,才进入编译路径。对偶发任务,缓存 prompt 或继续远程调用可能更简单。

10.2 把规格当作可测试源码

自然语言规格不应只是一段说明。建议和代码一起版本化,并附:

  • 正常样本、边界样本和禁止行为;
  • 明确的输入输出 schema;
  • 域外输入的期望处理;
  • 不允许被自由改写的顺序、字段和数值约束;
  • 每次重新编译必须通过的 regression suite。

规格变更应生成新版本 artifact,而不是无声覆盖旧 adapter。

10.3 采用分层验证与回退

运行链路可以设计为:

输入
  -> 域内/域外检查
  -> 本地神经函数
  -> schema 与规则验证
  -> 通过:返回结果
  -> 不通过:确定性 fallback、远程大模型或人工复核

对 DSL、JSON 和标签任务,尽量让编译函数输出受限中间表示;关键副作用由传统代码在校验后执行。记录失败输入并周期性更新 golden set,但不要未经审查就把用户数据回灌训练。

10.4 做真实的 A/B 与漂移监控

论文的 benchmark 分数不能替代业务分布评测。实际部署应比较 fast compiler、Compile by Training、远程大模型和规则基线,至少报告准确率、拒答率、回退率、成本、延迟和最坏类别。教师、解释器、scaffold 或规格任一变化,都应触发成对回归测试。

11. 综合判断

维度判断依据
问题定义明确识别规则与逐次远程调用之间的高频模糊函数
方法新意中高PAW 热启动、合成监督、LoRA 训练和可下载函数形成完整编译链
核心实验困难切片提升大,但缺全量结果、方差、置信区间与组件消融
系统工程流式合成/训练、队列、缓存、持久 job 与 artifact 存储较完整
应用证据中低展示多样且有真实流量,但严格质量评测不足
复现条件代码、配置和 prompts 公开;依赖未公开成本的 GPT-5.4-mini/5.5 与 GPU 服务
生产成熟度中低仍缺成本模型、SLA、OOD、漂移、安全和大规模并发证据

这篇论文最重要的启示,是把“大模型调用”重新放到软件生命周期中思考。对于重复的模糊函数,推理不一定永远是一项在线服务;它可以被前移为一次编译,把规格固化成轻量参数,再由小模型执行。PAW 提供秒级草稿,Compile by Training 提供分钟级优化,二者共同形成可选择的编译预算。

但自然语言规格不是形式化证明,教师合成也不是覆盖保证。当前 83.6% LEM 说明这条路径已经能显著修复某些快速编译失败任务,却离“像普通函数一样可靠”仍有距离。真正可用的产品不会只下载一个 adapter 就结束,而会把规格版本、测试集、验证器、回退、成本核算和漂移监控一起纳入 build pipeline。

参考资料

  1. Deng, Y., Nie, P., & Shieber, S. Compile by Training: Turning Natural-Language Specifications into Local Neural Functions, arXiv:2609.04199, 2026.
  2. Hugging Face. Paper detail: Compile by Training.
  3. Deng, Y. et al. Compile by Training official repository.
  4. Zhang, W. et al. Program-as-Weights: A Programming Paradigm for Fuzzy Functions, arXiv:2607.02512, 2026.
  5. Hu, E. J. et al. LoRA: Low-Rank Adaptation of Large Language Models, ICLR 2022.
  6. Viswanathan, V. et al. Prompt2Model: Generating Deployable Models from Natural Language Instructions, EMNLP 2023 System Demonstrations.
  7. Wang, Y. et al. Self-Instruct: Aligning Language Models with Self-Generated Instructions, ACL 2023.
  8. Zhao, J. et al. LoRA Land: 310 Fine-tuned LLMs that Rival GPT-4, 2024.