本页目录 OneStreamer

OneStreamer

OneStreamer 将流式视频中的看、记、答统一为主动生成过程,以分层字幕记忆保存离开视觉窗口的证据,并用状态转移选择监督学习何时响应。4B 模型在八项在线理解基准上取得对比方法最佳汇总成绩,同时显著压缩长视频上下文与首字延迟。

论文基本信息

  • 题目:OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
  • 作者:Xiangyu Zeng、Yuandong Yang、Zhiqiu Zhang、Yuhan Zhu、Xinhao Li、Qingyi Si 等 24 人
  • 机构:南京大学、上海人工智能实验室、京东、上海交通大学、中国科学技术大学、中国科学院、香港中文大学、北京大学、清华大学、复旦大学、浙江大学
  • 模型:OneStreamer-4B,基于 Qwen3-VL-4B-Instruct
  • arXiv:2610.01762v1,2026 年 10 月 1 日提交,类别 cs.CV,共 29 页、12 幅图、20 张表
  • Daily Papers:Hugging Face 页面 2026 年 10 月 2 日榜首
  • 链接:Hugging Face 详情页;arXiv 摘要页;arXiv PDF 全文;项目主页;代码仓库

一句话结论

OneStreamer 的关键不是单独造一个更大的视频缓存,而是让同一个生成模型一边观看、一边把已确认事实写成分层文本记忆,并用选择性的状态转移监督决定何时记录、等待或作答;它在八项流式视频基准上都取得了对比方法中的最佳汇总成绩,但文本记忆会继承生成错误,且论文尚未证明这种结果能跨模型规模、真实设备与开放环境稳定复现。

背景与动机

离线视频问答通常假定整段视频已经到手,模型可以反复读取全部帧。真实的直播助手、可穿戴设备或安防系统面对的却是无限增长的视频流:它必须只使用当前时刻以前的证据,既不能提前看到未来,也不能无限保留过去的视觉 token。

这造成三个互相牵制的问题:

  1. 当前感知与长期记忆争夺上下文。 保留完整视觉历史能帮助回忆,却让旧帧占据大量上下文和算力,并可能干扰对最新画面的细粒度理解;只保留最近窗口又会遗失早期证据。
  2. 未来任务在观察时未知。 早期出现的门牌、物品位置或动作细节,当时看似无关,几分钟后才可能被用户询问,因此不能只做面向当前问题的检索或压缩。
  3. “答什么”之外还有“何时答”。 主动视频助手需要在证据不足时保持安静,在证据逐渐出现时等待,并在信息足够后及时回答。逐时刻密集标注状态会被大量重复的“静默”标签主导。

已有长视频方法通常从视觉压缩、检索、窗口选择或结构化记忆入手;流式思考方法保留推理轨迹,但推理文本未必是可复用、带时间依据的事实记录;主动响应方法则多以状态 token 或额外策略控制时机。论文的出发点是把这些原本分开的职责统一成一种生成行为:模型既可以生成面向用户的回答,也可以生成只供未来使用的事实记忆。

核心贡献

  1. 提出 OneStreamer,用单一因果视觉—语言序列统一当前感知、无查询记忆写入和主动响应,不需要额外检索器、记忆编码器或外部状态机。
  2. 提出 Proactive Hierarchical Caption Memory(PHCM),将已观察证据写成局部细节与事件摘要两级、带时间依据的文本记录,用紧凑文本替代离开窗口的历史视觉特征。
  3. 提出 Proactive State Transition Learning(PSTL),完整保留所有输出锚点,并对高频状态变化与状态保持位置做有结构的选择监督,缓解“静默”标签压倒稀疏响应的失衡。
  4. 构造 OneStreamer-1M:总计 1,160,004 条流式交互记录,覆盖记忆、感知、主动问答和连续交互;其中新合成数据经过内容验证、证据区间定位和响应时刻校准。
  5. 在四项感知/记忆基准和四项主动响应基准上验证 4B 模型,主表中的八项汇总成绩均高于所比较的方法;附录进一步分析了训练数据、两级记忆、在线吞吐和失败案例。

方法:把主动生成变成感知、记忆与响应的共同接口

1. 单一因果流式序列

视频被按时间顺序切成片段。视觉编码器提取新片段的视觉 token,projector 将其映射到 LLM 空间;系统只保留最近 N 帧的 FIFO 视觉窗口,并将它与此前生成的字幕记录、对话历史交错输入 LLM。任何时刻的输入都只包含当时已经出现的信息。

模型通过控制 token 选择下一步行为:

控制 token含义是否生成后续文本
</Silence>继续观察,不记录也不回答否
</Observe>写入对象、动作、场景或状态变化等局部事实是
</Summary>为已经结束的事件或片段写入高层摘要是
</Standby>与问题相关的证据正在出现,但尚不足以回答否
</Response>证据已经足够,生成用户可见答案或任务输出是

这个设计把“什么时候输出”和“输出什么”都交给同一个自回归分布。训练时所有控制 token 仍留在序列里;推理时不再使用 PSTL 的采样掩码,也没有独立的转移策略。

2. PHCM:用两级文字保留已经离场的证据

PHCM 包含两类时间对齐记录:

  • </Observe> 对应密集、局部的事实,例如可见文字、物体位置、短动作和状态变化;
  • </Summary> 对应更稀疏的事件级摘要,只在一个事件或片段完成后生成。

记录必须在支撑它的视觉区间全部出现之后才被释放。生成后,它会追加到文本历史中;原始帧随后可以退出 Recent-N 视觉窗口,而事实记录继续参与后续预测。于是当前画面仍以高分辨率视觉 token 表示,较远历史则被压成可读文本。

这种做法与传统检索记忆有明显区别:写入发生在未来问题出现之前,是 query-independent 的;读取也不是检索一次外部数据库,而是直接利用已在因果上下文中的记录。它的优势是简单、可审计,风险则同样直接——一旦写入时看错,错误会成为后续回答的上下文。

3. PSTL:不让重复静默淹没真正的输出时刻

密集监督每个时刻的控制状态,会产生远多于响应的 </Silence>。只监督状态变化又会丢掉“此时应保持当前状态”的学习信号。PSTL 按相邻控制状态的转移类型 X → Y 对 token 分组,再用当前序列中“指向输出锚点的最大分组大小”定义统一配额:

q = max_X max_{a in Aτ} n_(X→a)
|I_(X→Y)| = min(n_(X→Y), q)

其中 Aτ 是任务对应的输出锚点集合:PHCM 使用 </Observe> 与 </Summary>,主动问答和主动交互使用 </Response>。小组全部保留,大组均匀无放回下采样到配额 q。最终只有选中的位置计算状态交叉熵:

L_state = -1/|I| · Σ_(i∈I) log pθ(z_i | c_i)

掩码只作用于该位置的状态损失,不删除 token、不阻断注意力,也不影响字幕与回答正文的完整 next-token 监督。这样既保住所有真正启动文本输出的锚点,也保留了有代表性的状态变化和状态持续样本。

数据:OneStreamer-1M 如何构造

数据组成

论文列出的 1,160,004 条记录分为四类:

任务族记录数主要能力
感知与记忆问答630,850通用/空间问答、时序定位、计数、预测、风险推理等
主动交互271,570连续描述、提醒、主动计数、视觉交互、过程协助等
主动问答197,584通用问答、视频对话、异常、动作/表情、过程问答等
主动字幕记忆60,000分层字幕与扁平字幕

数据既包含 OneStreamer-Core 新构造样本,也清洗整合了 Streamo、JoyAI-VL-Interaction、MMDuet2、ViSpeak、StreamForest、VideoChat-OL、Seeker 和 VST 等公开数据。作者按原始视频来源对全部评测集做去污染:只要训练样本与测试样本来自同一源视频,即使时间区间不重叠也会删除。

字幕合成

作者先用语义检索、镜头检测和视觉丰富度筛选事件密集视频,排除低质量、长时间静止、黑帧、镜头过碎或解码失败的样本。随后由 Gemini 3.1 Pro 与 Seed 2.1 Pro 生成帧/片段、事件段和整段视频三个粒度的时间戳字幕,并检查事实支持、时间边界与跨层一致性。

局部字幕只在其证据区间结束后作为 </Observe> 目标出现,事件摘要只在事件完成后作为 </Summary> 目标出现。整段视频字幕不写入长期记忆,而是在视频结束后作为指令式总结任务的 </Response> 目标。这一细节避免模型在事实尚未发生时提前泄露未来内容。

问答合成与响应时间校准

针对状态跟踪、动作预测、提醒和计数等能力,闭源模型先基于结构化元数据生成问答,再定位包含必要证据的粗粒度时间区间。验证阶段只把该区间、问题而非参考答案交给 Qwen3.5-397B-A17B;无法恢复正确答案的样本会被丢弃。

在通过验证的区间内,系统按 1 秒步长扫描候选响应时刻。推理型问答用 Qwen3.5-9B 计算参考答案在前置 4 秒视觉窗口下的条件似然,感知型任务则用 WeMM-Embedding-9B 计算事件描述与前置 2 秒窗口的相似度。分数经短窗口中位数平滑后,选择最早达到“距峰值不超过 0.04”的时刻,并再次用视频前缀验证可回答性。

校准使 86.62% 的记录获得更早的响应时刻,平均提前 13.72 秒。作者同时承认,它通常能保证证据充分,却不一定找到理论上最早可回答的瞬间。

训练与评测设置

OneStreamer 从 Qwen3-VL-4B-Instruct 初始化,注册新的响应控制与摘要 token,进行一阶段监督微调。视觉编码器冻结,只训练 projector 和 LLM。论文报告加载 991,773 个过滤、采样后的训练样本,经 soft packing 得到 150,261 条序列;最大序列长度 131,072 tokens,动态采样 1–4 FPS、最多 2,048 帧。

训练使用 AdamW、峰值/最低学习率 1×10^-5 / 1×10^-6、3% warmup、全局 batch size 128、BF16、FSDP、FlashAttention-2 和完整 activation recomputation,在 4 个节点的 32 张 NVIDIA H200 上训练 1 个 epoch,计划 1,174 步,随机种子为 42。

评测覆盖八个流式视频基准:

  • 感知与记忆:OVOBench、StreamingBench Real-Time、OVBench、ODVBench;
  • 主动响应:ProactiveVideoQA、OmniMMI、OVO-Timing、ViSpeak。

推理默认使用 greedy decoding。部分对比结果直接取自原论文,没有已报告成绩的官方 checkpoint 则由作者重新评测,因此主表并非所有模型都在完全同一个评测实现中重跑。

主要实验结果

八项基准

主表的汇总结果如下;不同列使用各自基准指标,数值适合做同列比较,不应跨列直接平均解释:

模型参数量OVOStreamingOVODVProactiveVQAOmniMMIOVO-TimingViSpeak
VideoChat34B58.581.962.570.837.624.633.61.05
MOSS-VL-Realtime11B70.282.953.763.947.232.738.52.48
Qwen3-VL 基座4B58.881.855.457.634.329.429.42.41
OneStreamer4B72.186.966.871.348.736.641.62.87

相较同尺寸 Qwen3-VL 基座,OneStreamer 在前四项感知/记忆基准分别提升 13.3、5.1、11.4 和 13.7 分;在前三项主动响应基准提升 14.4、7.2 和 12.2 分,ViSpeak 从 2.41 提高到 2.87。相较 11B MOSS-VL-Realtime,它在八项汇总指标上也全部领先,但领先幅度从 1.5 分到 17.6 分不等。

论文所说的“八项最佳”需要限定为主表所比较的方法与汇总指标,而不是已经覆盖所有现有系统的绝对 SOTA 证明。不同方法的可用列不完整,部分数据来自各自论文,且没有给出多随机种子或置信区间。

PHCM 是否真的兼顾当前感知与历史记忆

同一 checkpoint 下,论文比较三种推理策略:保留完整视觉历史(Full)、只保留最近 16 帧(FIFO)、最近 16 帧加字幕记忆(PHCM)。

策略OVO Backward ASIOVO Backward EPMOVO Real-TimeOVO OverallStreaming Real-Time
Full67.663.070.970.980.5
FIFO63.562.080.970.186.3
PHCM71.662.681.472.186.9

Full 的历史记忆较强但实时感知明显下降;FIFO 恢复当前感知却遗忘远处证据。PHCM 的 EPM 略低于 Full(62.6 对 63.0),但在 ASI、实时感知和总体分数上都更高。这支持“文本远端记忆 + 近期视觉窗口”不仅是折中,而是在多数指标上同时改善两端。

进一步消融显示,只保留 </Observe> 时 Streaming/OVO 为 86.9/71.7,只保留 </Summary> 为 86.6/71.2,两者共同使用达到 86.9/72.1。局部事实承担了大部分收益,事件摘要提供了互补增益。

PSTL 是否只是少算一些 loss

状态监督策略监督比例ProactiveVQAOmniMMIOVO-Timing
全量状态 + CE100.0%26.130.81.5
全量状态 + Focal100.0%47.032.826.5
随机稀疏 + CE27.5%26.627.41.4
仅状态变化 + CE18.1%46.727.415.3
PSTL + CE27.5%48.736.641.6

随机选择相同比例的 token 几乎没有帮助,说明收益并非单纯来自降低监督量;只监督状态变化在 ProactiveVQA 尚可,却在时机任务上明显落后。PSTL 的关键是同时保留输出锚点、状态变化和有代表性的状态持续位置。

记忆写入的代价

在单张 H200 上处理一个 360 秒样本时,回答阶段的 PHCM 使用 4,308 个上下文 token、9.98 GB 显存和 0.124 秒 TTFT;完整视觉历史为 62,094 tokens、25.18 GB 和 4.560 秒。PHCM 相对 Full 将上下文缩短 93.1%、显存降低 60.4%,首 token 延迟也大幅下降;相对 FIFO 则多 1,272 tokens、0.29 GB 和 0.030 秒。

更严格的在线写入测试每秒更新一次,Recent-128 帧的 PHCM 平均每次更新耗时 0.636 秒,峰值显存 10.327 GiB,能够跟上 1 秒输入间隔。Full 平均需 4.013 秒并达到 29.754 GiB,已无法实时处理。不过这些数字只来自一个 360 秒片段和一张 H200,不能直接外推到消费级 GPU、边缘设备或长时间多路视频。

局限与审慎解读

  • 记忆是生成文本,不是可回溯证据。 PHCM 不保留被丢弃的原始视觉特征,也没有外部检索器。错误、遗漏或过度概括一旦写入,就可能在后续问题中持续传播。
  • 论文展示了“写错且不纠正”的失败。 在打印机案例中,模型把抬起盖子误报为关闭;随后画面已清楚显示打开状态,它仍连续输出 </Silence>,没有撤回先前描述。这暴露了状态变化识别和事后纠错两项缺口。
  • 训练监督高度依赖更强闭源模型。 Gemini 3.1 Pro、Seed 2.1 Pro 参与字幕、问答与区间生成,Qwen3.5-397B-A17B 和 Qwen3.5-9B 又参与验证与时刻校准。最终 4B 模型的能力提升不能完全归因于结构设计,也包含大规模教师合成与筛选的贡献。
  • 时间校准不是最早响应的严格标注。 固定 2/4 秒窗口、0.04 峰值容差和模型判分构成启发式流程;作者的人工抽检也只支持“通常证据充分”,未证明响应点最优。
  • 评测可比性有限。 一部分基线引用论文结果,一部分由作者重跑;模型输入窗口、采样方式和 ASR 使用条件可能不同。主结果没有报告方差或显著性检验,训练也只列出单个随机种子 42。
  • 泛化范围仍窄。 论文只训练一个 4B Qwen3-VL 衍生模型,没有规模曲线、跨架构验证、多语言分析或真实持续数小时/数天的部署测试。
  • 成本与隐私问题尚未展开。 即便视觉历史被压缩,系统仍需要持续视觉编码和周期性 LLM 推理;若用于穿戴设备、家庭摄像头或安防,主动记录的事实文本还会形成可搜索的敏感行为日志。
  • 安全响应没有专门评测。 在医疗、驾驶、工业告警等场景,过早、过晚、漏答和错误记忆的代价不同,而现有平均指标不足以刻画风险敏感的时机决策。

应用影响

OneStreamer 最直接的应用是需要“先观察、后提问”的持续视频助手,例如可穿戴记忆助理、家庭场景回顾、长时间直播分析、设备巡检、过程教学和安防事件追踪。PHCM 的文本记录天然便于审计、搜索和传递给下游 agent,且比不断累积视觉 token 更接近可部署的资源曲线。

它对系统设计的更大启示是:流式智能体的 memory write 可以成为模型必须学习的一级动作,而不是推理管线外附加的摘要任务。</Observe>、</Summary>、</Standby> 和 </Response> 共同构成一个轻量控制协议,使“记什么、什么时候记、什么时候答”都能被统一训练。

但实际产品不应只复制这组 token。更稳妥的落地需要为每条文本记忆附带源时间、置信度和可回看证据;允许后续帧触发修订或撤销;针对告警类任务按错误成本校准响应阈值;并设置记忆保留、用户授权和敏感信息删除策略。论文的打印机失败案例恰好说明,持久记忆系统必须同时拥有“写入”与“纠错”能力。

相关工作

OneStreamer 位于四条研究路线的交点。

第一条是长视频与在线记忆。MovieChat、LongVU、Flash-VStream、StreamForest、StreamBridge、StreamingVLM 等工作通过稀疏化、压缩、选择、检索或分层结构延长可访问历史。OneStreamer 的区别是把远端视觉证据主动转写成文本事实,并与固定的近期视觉窗口组合。

第二条是流式描述与持续思考。VideoLLM-Online、VideoChat-Online、VST、ProAct-VL 等方法在视频到达时持续生成描述或推理。OneStreamer 强调记忆文本必须是带时间依据、可供未来未知任务复用的事实,而不是只服务当前输出的思维轨迹。

第三条是主动响应时机。Dispider、Streamo、AURA、MMDuet2、Em-Garde、ProactiveVideoQA 等研究使用状态 token、相关性/准备度信号或强化学习决定何时输出。PSTL 沿用了生成式状态控制,但把重点放在监督选择:既不让静默占据全部梯度,也不放弃状态持续样本。

第四条是数据中心的能力构建。OneStreamer-1M 并非仅扩大样本量,其 CQTC 消融显示,在不增加样本数的情况下,内容验证和响应时间校准将 OVO-Timing 从 33.0 提升到 42.0,并使五项平均分从 53.4 提升到 55.6。这说明对流式任务而言,“标签在什么时候生效”与“标签是什么”同样重要。

总结

OneStreamer 给出了一个结构简洁但工程完整的答案:保留近期视觉窗口,把已经发生的事实主动写成两级文本记忆,再用选择性状态监督学习输出时机。论文的说服力来自三个层次彼此呼应:PHCM 在消融中同时改善远端记忆和实时感知,PSTL 在更少监督位置上胜过密集与随机稀疏基线,在线测试也显示文本记忆的资源增长远慢于完整视觉历史。

最需要保留的判断边界是,这是一项由大规模合成数据、强教师筛选和高端硬件共同支撑的 4B 模型结果。它证明了“主动生成可作为记忆写入接口”的可行性,却还没有解决生成记忆的可信度、持续纠错、跨架构泛化和风险敏感时机控制。若后续系统能让每条记忆可追溯、可置信、可修订,这条路线才可能从优秀的流式视频基准方案,进一步成为可靠的长期视觉智能体基础设施。

参考资料

  1. Hugging Face Daily Papers:OneStreamer
  2. arXiv:OneStreamer
  3. arXiv PDF 全文
  4. OneStreamer 项目主页
  5. OneStreamer GitHub 仓库
  6. OneStreamer-4B 模型
  7. OneStreamer-1M 数据集