本页目录 Post-Training Leaves Behavioral Shadows on Unrelated Decisions

Post-Training Leaves Behavioral Shadows on Unrelated Decisions

深入解析 Active Taskless Distillation 如何从同源教师对无关文本的一词选择中读取后训练“行为阴影”,并在 HumanEval+ 上迁移部分编码能力;同时审视近边界查询、严密对照、跨任务证据、同祖先依赖、低带宽边界及其对模型蒸馏、能力审计与黑盒隐私的影响。

自动研究时间:2026-09-30 09:01(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 29,列表最顶部为 Post-Training Leaves Behavioral Shadows on Unrelated Decisions。1
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv v1 完整 PDF 与 HTML 正文(17 页、6 幅图、13 张表,含附录)-> 官方代码仓库。本文不以列表摘要代替论文正文。

执行摘要

一个经过编码数据后训练的模型,面对“jacket 还是 tie”这类与代码完全无关的二选一问题时,答案会不会留下编码训练的痕迹?这篇论文给出的回答是:**会,而且把数千个极弱的一词选择组合起来,可以让另一个模型恢复一部分教师的目标能力。**作者把后训练在无关输入上造成的细小决策变化称为“行为阴影”(behavioral shadow),并提出 Active Taskless Distillation(ATD)主动寻找最容易暴露这种变化的决策边界。2

ATD 的关键不是让私有教师解释、写代码或输出概率,而是先用公开祖先模型筛选两个普通词几乎等概率的提示,再让私有教师对每个提示只贪心输出一个 token。教师与公开祖先共享起点,后训练更新 δ\delta 即使很小,也可能在这些近似平局处翻转答案。学生同样从公开祖先初始化,只用保留下来的“提示 -> 普通词”对做交叉熵训练,从未看到教师的目标任务数据、目标任务回答、参数或 logits。

主实验基于 Qwen2.5-1.5B-Instruct:17,858 次近边界查询保留 5,664 条单词训练样本,覆盖 128 个普通词。ATD 学生在 HumanEval+ 上达到 51.22%,比保持词频、难度分层和训练预算完全一致、但打乱提示—单词对应关系的精确干扰匹配对照高 5.34 个百分点,95% 置信区间为 [1.22, 9.60]。五次独立采集、每次三个训练种子的 15 组比较全部为正,平均增益 4.80 个百分点。论文还在科学知识、常识推理、阅读理解,以及 Qwen3、Llama 和不同参数规模上观察到正向均值。2

最值得重视的不是“一个词教会了模型写代码”这种戏剧化表述,而是三个更精确的发现:第一,后训练更新会沿大量无关决策方向留下分布式痕迹;第二,主动选择公开祖先的决策边界,比随机收集同等数量的教师答案更有效;第三,这些痕迹具有来源特异性、可组合性和强度信息,不只是一个笼统的“模型变了”信号。

但证据也有清楚边界。ATD 依赖教师、学生共享已知公开祖先;面对不兼容祖先、背答案型教师、替换密码任务或教师本身增益很小的端点,迁移失败或接近于零。新增模型上的置信区间仍包含零,实验主要覆盖 0.5B 至 4B 级模型,且通道需要上万次精心构造的查询。因此,这项工作证明的是受控同祖先条件下的低带宽能力迁移与更新泄漏,不是任意黑盒模型都能被少量普通词完整复制。

1. 论文基本信息

项目内容
论文标题Post-Training Leaves Behavioral Shadows on Unrelated Decisions
论文编号arXiv:2609.29233
当前版本v1,2026-09-24 提交,共 17 页、6 幅图、13 张表3
Daily Papers 状态2026-09-29 列表榜首,Hugging Face 当日第 11
作者Ziyang Zhang、Yubin Jing、Yuanhao Zeng、Yuyao Li、Haofan Wang、Yichen Gong
机构Peking University、Georgia Institute of Technology、ShanghaiTech University、Tsinghua University、Lovart AI
核心方法Active Taskless Distillation(ATD)
主要模型Qwen2.5-1.5B-Instruct;扩展到 Qwen3-1.7B、Qwen3-4B、Llama-3.2-1B
主评测HumanEval+ greedy pass@1;另含 6 个选择题基准与 GSM8K、MBPP+ 诊断
主要结论无关输入上的单 token 决策可携带后训练更新中与目标能力相关的信息

核心链接:

2. 背景与动机:后训练的影响不止存在于目标任务

2.1 从目标能力到“行为阴影”

传统上,人们通过目标任务测量后训练:编码模型看 HumanEval,数学模型看 GSM8K,偏好优化模型看对齐评测。这种做法隐含了一个直觉:训练的主要影响应出现在训练语义附近。但参数更新会同时改变大量输入上的 logit,即使输入和目标能力没有可见语义联系。

论文把这种外溢定义为行为阴影:若公开基座为 M0M_0,私有教师为 MT=M0+δM_T=M_0+\delta,那么更新 δ\delta 不仅改变代码题的解法,也可能改变普通故事后面更偏好哪个日常词。单次变化几乎没有意义;成千上万个经过选择的微小变化共同构成更新的可观测投影。

作者关注两个问题:

  1. 可观测性:只通过无关输入上的个别选择,能否发现私有后训练更新,而不访问参数、logits 或目标任务回答?
  2. 能力迁移:学生学习这些选择后,能否在从未见过的目标任务上获得教师的一部分提升?

第二问比普通模型指纹更强。识别“这是不是同一个模型”只需要稳定差异;让学生在可执行代码评测上真正多做对题,则要求差异中包含可用于改变功能行为的信息。

2.2 为什么已有蒸馏方式不回答这个问题

经典知识蒸馏通常需要教师概率分布,指令蒸馏需要完整回答或推理链,on-policy distillation 也会在学生轨迹上请求教师监督。这些数据的可见内容直接表达目标知识,因此无法判断“语义无关的行为变化本身”是否携带能力。

先前的 subliminal learning 工作已经表明,性格、偏好或隐藏倾向可以经由表面无关的数据传给学生;主动学习和模型提取研究则长期利用决策边界提高查询信息量。ATD 把两条路线接到一起:用公开祖先主动找边界,以私有教师的硬选择读取更新,再以真实目标任务验证是否发生能力迁移。

3. 核心贡献

3.1 把后训练更新变成一组一比特观测

每个 ATD 样本只保留教师在两个普通词之间的最终选择。没有概率、解释或多 token 内容,因此可近似理解为对未知更新 δ\delta 的一比特测量。单个样本极弱,但不同提示对应不同梯度方向,合在一起可约束更新在这些方向上的投影。

3.2 主动寻找最敏感的公开决策边界

ATD 不依赖私有教师来筛选问题。它只用公开祖先找出两个候选词接近 50/50 的状态,再固定查询集。这既避免根据教师响应事后挑样本,也让微小更新更容易翻转 top-1 决策。与相同查询预算或相同训练行数的被动采集相比,主动采集在 HumanEval+ 上分别领先 4.27 和 5.03 个百分点。

3.3 用严格对照隔离“对应关系”而非词频效应

论文没有只拿 ATD 学生与原始基座比较,而是设计全局标签打乱、公开祖先标签、随机边际标签和精确干扰匹配四类对照。最强的精确对照复用相同提示、相同输出词多重集、相同难度分箱、相同训练顺序与预算,只把一半提示与教师词的正确对应关系打断。于是信号组与对照组的差异更接近于“哪一个词属于哪一个提示”所携带的信息。

3.4 同时验证来源、组合与强度

代码、数学和科学教师形成的阴影,在各自匹配端点上提升最大,排除了统一“多训练一点就会变好”的简单解释。把数学与代码阴影按 50/50 混合时,学生同时恢复两个近乎正交的方向;沿教师训练检查点改变更新强度时,学生表示中的恢复投影也复现真实强弱顺序。

3.5 主动报告失败边界

论文不仅给正结果,还构造“背诵标准答案”的编码教师、注入替换密码的教师、不兼容祖先教师,以及教师增益较弱的 MBPP+ 端点。它们没有稳定迁移,说明教师优势的数值大小并不足够,学生能否从共享表示中被“唤出”相应能力同样重要。

4. ATD 方法

4.1 局部线性直觉

对提示 xix_i 和候选词 ai,bia_i,b_i,定义两词 logit 差:

mi(θ)=zθ(ai∣xi)−zθ(bi∣xi).m_i(\theta)=z_\theta(a_i\mid x_i)-z_\theta(b_i\mid x_i).

在公开祖先参数 θ0\theta_0 附近做一阶展开:

mi(θ0+δ)≈mi(θ0)+gi⊤δ,gi=∇θmi(θ0).m_i(\theta_0+\delta)\approx m_i(\theta_0)+g_i^\top\delta, \qquad g_i=\nabla_\theta m_i(\theta_0).

当 ∣mi(θ0)∣|m_i(\theta_0)| 很小时,原本只略偏向一方的决定可能被 gi⊤δg_i^\top\delta 翻转。教师最后选 aia_i 还是 bib_i,相当于告诉观察者 mi(θ0)+gi⊤δm_i(\theta_0)+g_i^\top\delta 的符号。它不提供更新幅度,也看不到与所有载体梯度正交的更新分量,因此天然是部分、低带宽观测。

4.2 三步数据流程

  1. 筛选近似平局:从 128 个经过目标词过滤的普通单 token 词汇构造二选一提示。公开祖先对 bib_i 的二词归一化概率记为 qiq_i,仅保留 ∣qi−0.5∣≤0.02|q_i-0.5|\le 0.02,并要求全词表 top-1 也必须是两个候选之一。
  2. 一次查询教师:查询集在看见任何私有响应前固定。教师对每个提示做一次全词表贪心解码;若输出不属于两个候选词,就丢弃该行且不重采样。
  3. 训练同源学生:学生从同一个 M0M_0 初始化,只对教师返回的一个 token 计算全词表交叉熵,提示本身只提供上下文。

一个实际载体先给出龙虾与心脏的普通故事问题和一串日常词,再要求从 jacket | tie 中选一个。公开祖先对 tie 的二词概率是 0.5044,编码教师却选 jacket。学生只看到这一提示—单词对,看不到代码或数学。2

4.3 主实验的数据与训练配置

项目设置
公开祖先与学生起点Qwen2.5-1.5B-Instruct
编码教师同一祖先上的 rank-16 code-DPO LoRA,带小规模 chosen-token SFT 辅助
教师训练数据13,607 条过滤后的 CodeRM-UnitTest 偏好对;12,921 训练、686 验证
近边界查询数17,858
最终保留载体5,664,保留率约 31.7%
载体词汇128 个普通单 token 词;审计未发现代码、数学、基准、任务词或数字
学生适配rank-16 all-linear LoRA,AdamW,固定 157 步
主端点HumanEval+ 164 题,greedy pass@1,通过执行判分

教师数据在训练前去除与 HumanEval+、MBPP+ 的精确提示、入口函数和 5-gram Jaccard 高重叠项。这个过滤只保护教师训练;ATD 学生从未接触该编码语料。选择题端点用答案似然、无 chain-of-thought 评分,端点只在冻结后的评测阶段出现。

4.4 为什么精确干扰匹配对照重要

如果仅随机打乱“左词/右词”标签,输出词频或教师翻转公开祖先的比例仍可能改变。论文用整数可行性问题构造最强对照,同时满足:

  • 每个训练/验证划分中的输出词多重集与信号组完全相同;
  • 每个公开边界难度分箱中,与祖先不一致的次数相同;
  • 对照只在 50% 载体上与教师的逐提示选择一致。

这相当于在“词只能分配给包含它的二选一提示”约束下做带侧约束的二分匹配。它不能排除所有潜在混杂,但较好地隔离了提示—词对应关系,而非特定单词出现次数、难度或一般微调效应。

5. 主要实验结果

5.1 主结果:编码能力在同祖先学生中部分恢复

对照组对照 HumanEval+ATD 相对增益种子数
精确干扰匹配45.88+5.34 [1.22, 9.60]4
全局教师标签打乱46.19+5.03 [0.91, 9.30]4
公开祖先标签46.65+4.57 [0.91, 8.54]4
随机边际标签45.12+6.71(单种子,无区间)1

ATD 信号组为 51.22%,与该实验教师的聚合分数相同。更有说服力的证据来自单题行为:在教师相对祖先修正的 19 道 HumanEval+ 题、共 76 个种子—题目单元中,ATD 学生解决 49 个(64.47%),精确对照只解决 16 个(21.05%);学生相对祖先的逐题变化也更接近教师,余弦从 0.398 提高到 0.701。

HumanEval/158 要求按不同字符数选词并按字典序打破平局。基座与所有精确对照都误用词长,教师与四个 ATD 种子都学到 len(set(w)) 式规则。该规则没有出现在载体中,而评测通过执行完成,因而比表面语言相似更难用模仿解释。

5.2 采集与适配稳健性

五份独立载体采集各自使用不同载体随机种子、重新训练的私有教师和对应精确对照,再各训三个学生种子。15/15 组信号—对照差为正,五份采集均值也全部为正;总体增益为 +4.80 [1.18, 8.74],采集间均值标准差为 0.83 个百分点。

适配方式信号对照增益(95% CI)
LoRA r1651.2245.88+5.34 [1.22, 9.60]
LoRA r3253.6647.10+6.55 [2.59, 10.82]
LoRA r6454.2745.12+9.15 [4.88, 13.87]
全参数 SFT50.0045.33+4.67 [1.22, 8.54]

结果不依赖 rank-16 LoRA,但不能从表格推导“rank 越大,ATD 必然越强”:每一行都重新采集并训练教师,样本不是只改变一个超参数的严格缩放曲线。

5.3 跨任务迁移

Qwen2.5-1.5B 上的七个任务各自训练独立教师,学生只学习对应教师在无关载体上的单词选择。七个信号组都胜过各自标签打乱对照:

来源/目标基座教师教师增益ATD对照ATD 增益(95% CI)
Code / HumanEval+43.2951.22+7.9351.2246.19+5.03 [0.91, 9.30]
ScienceQA77.6592.13+14.4879.3876.84+2.53 [1.57, 3.52]
OpenBookQA78.2086.40+8.2079.7377.67+2.07 [0.33, 3.87]
HellaSwag64.8487.14+22.3166.8263.93+2.90 [2.44, 3.36]
RACE-high76.1981.79+5.6076.7475.93+0.81 [0.24, 1.40]
CommonsenseQA74.3779.12+4.7576.2874.34+1.94 [0.76, 3.19]
PIQA76.9383.52+6.5877.7176.46+1.25 [0.15, 2.38]

迁移幅度通常只回收教师增益的一部分,而且“教师提升越大,ATD 提升越大”并不成立:HellaSwag 的教师增益 22.31 点,学生只比对照高 2.90 点;RACE-high 则只有 0.81 点。ATD 是受任务、表示与学生可表达能力共同限制的通道。

5.4 跨模型结果需要保守解读

作者在 Qwen3-1.7B、Qwen3-4B 和 Llama-3.2-1B 上也重新建立同祖先教师—学生链路,HumanEval+ 平均增益均为正。这说明现象不只存在于 Qwen2.5-1.5B;但三个新增模型的成对 95% 置信区间都包含零,证据强度低于主实验。论文覆盖的仍是小模型与有限家族,尚不能直接外推到闭源前沿模型。

5.5 信号具有来源特异性与可组合性

代码、数学、科学三个阴影交叉作用于三个端点时,每一行最大正效应都落在匹配任务;代码和科学对角线分别为 +5.34 与 +2.52 个百分点,非匹配项接近零或为负。若它只是一般正则化或训练强度效应,就不应出现这种对角结构。

数学与代码教师在诊断空间中的方向余弦为 -0.0002,近乎正交。以 50/50 载体混合训练后,学生相对打乱对照对两个方向都增加对齐,数学为 +0.046、代码为 +0.062,三个种子全部为正。随着混合比例从全代码移向全数学,恢复的表示系数也按预期单调变化。不过 GSM8K 端点的 100% 与 0% 差只有 +0.28 点且不显著,说明“表示可分解”比“最终分数精确跟随剂量”有更强证据。

6. 扩展方法:RPM 与多 token 观测

6.1 Reference-relative Pair-Margin

普通交叉熵会同时学习祖先已有的词偏好和教师更新新增的残差。RPM 目标把学生的两词 log-probability margin 减去冻结祖先的对应 margin,试图更直接学习 δ\delta 引起的相对变化。

RPM 在 HumanEval+ 相对 shuffle 的增益从 CE 的 +5.03 提高到 +6.30,在 ScienceQA 与 PIQA 也保持正向;但 OpenBookQA 从 +2.07 降到 +1.47 且区间跨零。作者因此把 RPM 定位为有潜力的边界感知改进,而不是全面优于 CE 的新主方法。

6.2 二十词宽通道

在 Qwen2.5-0.5B 上,作者让同一载体返回 K=20K=20 个词,并仍与保持答案多重集的精确对照比较。GSM8K 得到 +6.37 [4.37, 8.42];HumanEval+ 为 +1.02 [-0.81, 3.05],ScienceQA 为 +0.84 [-0.09, 1.78]。三任务的所有六个种子方向一致为正,但后两项区间包含零。

这表明行为阴影不限于单 token 界面,更宽观测可能提高算术任务的信息带宽;同时也说明增加 token 并不会自动在所有任务上产生可靠的大增益。

7. 与相关工作的关系

7.1 Subliminal learning:从特质传播走向能力迁移

既有 subliminal learning 研究关注教师的偏好、人格或行为倾向如何经由表面无关数据传播,也研究 divergence token、表示方向、忠实改写和二元偏好标签。ATD 的推进在于:主动选择同源祖先的近边界,只保留单词硬标签,并用 HumanEval+ 的外部执行验证功能能力,而非只测教师风格是否在学生上重现。

7.2 知识蒸馏:监督内容从答案变成决策扰动

传统蒸馏的信号是 soft logits、完整解答、推理过程或教师对学生轨迹的纠错。ATD 不让监督内容表达目标知识,而是把后训练更新在无关决策上的投影当监督。这不是更高效的通用蒸馏替代品,因为它需要已知祖先、精心选点且带宽很低;它更像用于研究“模型更新可从何处被读出”的实验仪器。

7.3 主动学习、模型提取与指纹

主动学习早已知道决策边界附近的查询更有信息量,模型提取与水印也利用黑盒输出识别或模仿模型。ATD 的特殊之处是边界由公开祖先而非私有教师概率确定,查询在看到教师答案前固定,最终目标不是复现普通查询输出,而是在未出现于查询集的目标任务上恢复提升。

7.4 Task vectors:参数差的行为投影

Task arithmetic 把后训练理解为参数差向量 δ\delta。ATD 可以视为不读取参数时,对 δ\delta 做一组符号化行为测量:每个近边界载体提供 gi⊤δg_i^\top\delta 的符号信息,学生再用梯度学习把这些约束写回自身参数。论文的来源特异性、混合可组合性和强度排序结果,与“阴影是结构化更新投影”这一解释相符。

8. 局限与批判性分析

8.1 同祖先假设既是方法核心,也是现实限制

ATD 需要知道公开祖先,并让学生从同一祖先初始化。论文自己的不兼容实验中,Qwen3-Coder-30B-A3B 到 Qwen3-1.7B、并行 Coder-7B 到 Qwen2.5-1.5B 都未迁移,即使教师目标增益分别为 17.68 和 40.25 点。闭源服务若没有公开基座、版本不明或经历多阶段训练,ATD 的选点和学生表示都可能失配。

8.2 “单词不含代码”不等于彻底排除所有统计联系

冻结审计排除了代码、数字、数学、基准和任务词,严密对照也匹配词频与难度。这显著削弱直接语义泄漏解释,但载体上下文的生成分布、普通词在基座表示中的潜在结构,以及筛选过程与模型预训练语料的关系仍可能影响通道。论文证明的是不可见于表面内容的功能信息存在,尚未给出其神经机制的唯一解释。

8.3 主要显著证据集中在小模型与少量端点

主结论最强的部分来自 Qwen2.5-1.5B 与 164 道 HumanEval+。虽有五次独立采集、多个种子和六个选择题端点,但新增模型家族的区间跨零,且没有 7B 以上同祖先的成功缩放实验。模型变大后,决策边界密度、更新局部性、学生优化和所需查询量都可能改变。

8.4 查询与训练成本不是“5,664 bit”这么简单

最终保留 5,664 个硬选择,但首先要在公开祖先上大规模构造并评分候选,再向教师发出 17,858 次有效近边界查询;只有约 31.7% 留下训练行。每个标签近似一比特,却还依赖完整提示、公开祖先概率和 157 步学生训练。论文展示的是教师输出带宽很低,不等于端到端计算或查询成本同样低。

8.5 统计显著不代表能力已完整复制

HumanEval+ 的 +5.34 点区间较宽,选择题增益多在 1 至 3 点,学生通常没有达到教师分数。MBPP+ 上教师相对基座只高 2.38 点,ATD 仅恢复 +0.33 或 +0.53 点,区间均跨零。应把结果理解为“回收可测的一部分更新效应”,而非从一词回答重建教师。

8.6 表示诊断并非独立的因果机制证明

来源对齐、组合与强度排序使用 512 个留出提示、每个 20 个状态、1024 词 logits 构成的功能指纹。它们与端点结果互相支持,但余弦、差分余弦和投影是作者定义的观测量;早期出现对齐并不证明表示变化因果上先于能力获得,论文也谨慎承认两类指标的统计功效不同。

8.7 非迁移案例仍留下“可唤出能力”的定义问题

背诵 HumanEval 标准答案的教师有 +39.02 点优势,替换密码教师约有 +97 点优势,两者都不迁移。作者解释为 ATD 更可能传递学生已经能表达、但尚未被充分唤出的能力,而不是新记忆。这个解释合理,却还缺乏可在训练前预测“什么能力可唤出”的操作性指标。

8.8 安全与隐私含义尚未做威胁模型量化

论文说明公开基座上的私有适配可能从看似无害的接口选择中泄漏,但没有评估攻击者在真实 API 的查询限制、采样随机性、系统提示、防滥用过滤、模型版本漂移和价格约束下能恢复多少能力,也没有尝试反推出训练样本。把 ATD 直接称为数据窃取攻击会超出当前证据。

9. 应用影响

9.1 黑盒模型更新审计

若服务商公开基座但私有化部署 LoRA 或 SFT 版本,近边界探针可用于检测更新是否存在、比较版本、判断更新更接近代码还是科学能力。与直接发送目标任务相比,无关探针更不容易被专门优化的演示回答干扰。不过上线审计必须先在目标模型家族上校准误报、漂移和采样方差。

9.2 低输出带宽的能力蒸馏

在教师不能返回 logits、长答案昂贵或目标数据受访问限制时,ATD 提供一种研究方向:把查询预算集中到高敏感边界,用硬标签回收部分能力。实际系统应把它视为传统蒸馏的补充,而非替代,因为共享祖先和低带宽限制非常强。

9.3 模型供应链与知识产权保护

对模型提供者而言,“接口只返回一个普通词”不等于不泄漏后训练信息。访问控制、速率限制和输出最小化无法单独阻止大量自适应或预构造探针聚合微弱信号。若私有适配本身是重要资产,安全评估需要覆盖跨输入的联合信息,而非只审查单条回答是否含敏感语义。

9.4 数据来源和更新归因

来源特异性结果提示,可以构造多个已知更新的行为指纹,判断未知模型更像哪类后训练来源。它可能用于内部模型版本治理、适配器混合检查和未经授权微调检测;但当前只验证少数任务方向,离可靠归因系统仍需要更大模型、更复杂更新和真实分布下的验证。

9.5 安全对齐的双刃剑

行为阴影可帮助红队发现安全微调是否在无关决策上留下稳定痕迹,也可能让攻击者探测或复制某些私有对齐更新。另一方面,论文没有证明有害能力、拒答策略或复杂价值偏好能以同样方式迁移。防御研究应先明确要隐藏的是参数更新存在性、能力类别、具体训练数据还是最终能力,不应把这些风险混为一谈。

10. 下一步值得做的实验

  1. 前沿规模缩放:在 7B、14B、32B 以上同祖先模型上测查询量、保留率、效应大小和计算成本的缩放规律。
  2. 未知或近似祖先:让攻击者只知道模型家族或候选基座集合,检验祖先识别与 ATD 能否联合完成。
  3. 真实 API 约束:加入温度采样、输出扰动、速率限制、系统提示、量化和版本滚动,建立可实际执行的威胁模型。
  4. 机制干预:定位哪些层、模块或表示子空间承载行为阴影,并通过消融、投影移除或低秩编辑检验因果性。
  5. 可迁移性预测:在查询前用教师—祖先差异、任务向量几何或基座能力上界预测某个更新是否能被学生唤出。
  6. 查询效率:从固定近似平局扩展到覆盖最大化、批量多样性或序贯实验设计,在更少教师调用下获得同等信息。
  7. 防御评估:比较 margin 扩大、随机化、回答聚合、蒸馏后再部署、适配器隔离等措施,区分降低泄漏与破坏正常质量的代价。
  8. 安全能力与记忆分离:分别测试拒答、安全分类、长程推理、事实记忆和新技能,建立“可唤出能力”与“新增知识”的实验边界。

11. 结论

这篇论文最重要的发现,是后训练更新并不会只在目标任务上显形。一个模型学会更多代码之后,它对大量普通词的细微偏好也会系统性移动;只要在公开祖先的决策边界上观察,这些移动就形成一条虽窄但可用的通道。ATD 用 5,664 个一词标签,在严格匹配对照下为 Qwen2.5-1.5B 学生带来 5.34 个百分点的 HumanEval+ 增益,并以跨采集、跨适配、跨任务和功能方向分析证明信号并非简单词频幻觉。

论文同样没有掩盖边界:通道低带宽、依赖同祖先、对任务和模型敏感,不能搬运背诵答案或任意新规则;跨家族扩展的统计证据也仍有限。因此,合理结论不是“普通词可以无条件复制私有模型”,而是:公开基座上的私有后训练会产生可聚合的行为侧信道,其中一部分信息足以改变同源学生的真实能力。

对研究者,ATD 是连接 subliminal learning、主动查询、task vector 与模型提取的新实验工具;对工程团队,它提醒我们重新审视蒸馏接口和模型更新隐私:判断输出是否敏感,不能只看单条回答的表面语义,还要考虑大量决策联合起来暴露了什么。

参考资料

Footnotes

  1. Hugging Face, Daily Papers(2026-09-29 页面);Post-Training Leaves Behavioral Shadows on Unrelated Decisions 详情页。 ↩ ↩2

  2. Zhang, Z. et al., Post-Training Leaves Behavioral Shadows on Unrelated Decisions, arXiv:2609.29233v1,正文、公式、表格与附录,包括 ATD、控制组、跨任务实验、功能诊断、RPM、多 token 扩展和失败边界。 ↩ ↩2 ↩3

  3. arXiv, Post-Training Leaves Behavioral Shadows on Unrelated Decisions 摘要页,v1 submitted 24 Sep 2026;PDF。 ↩