本页目录 GigaBrain-0.7

GigaBrain-0.7

基于 Hugging Face Daily Papers 2026-08-26 榜首论文,深入解析 GigaBrain-0.7 如何用三系统架构、3.7 万小时异构具身数据、统一多形态预训练与经验强化学习构建通用机器人基础模型,并审视其实验收益与证据边界。

自动研究时间:2026-08-27 09:03(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Aug 26,列表最顶部为 GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv HTML 全文、PDF 与完整 TeX 源(含实验表格和附录)。

执行摘要

GigaBrain-0.7 试图解决通用机器人模型的三个断点:视觉语言模型能理解场景却未必能稳定控制机器人;低层策略能输出动作却缺少对未来的预测与进度判断;大规模机器人数据来自不同形态、坐标系和控制接口,简单混合可能造成干扰。论文给出的答案不是一个单体端到端网络,而是一套分工明确、通过结构化接口协同的“三系统”具身基础模型:System 2 负责理解与规划,System 3 负责预测未来和评估进度,System 1 负责动作与控制。

系统的基础是大规模异构数据和统一训练。作者整理了 37,256.98 小时具身轨迹,覆盖 16 种机器人形态,并混合约 2.72 亿条视觉语言样本。System 1 采用 PaliGemma2 3B 与 0.5B Action Expert 组成的双流 Mixture-of-Transformers,一条路径自回归预测语言、子任务和离散动作,另一条路径用 flow matching 生成连续动作块;Soft Knowledge Insulation 则衰减动作损失回传到 VLM 的梯度,以兼顾具身适配与通用视觉语言能力。

System 3 是论文最有辨识度的部分。5B 的 GigaWorld-1 世界价值模型一方面生成短期未来视频,并把最后一帧作为视觉子目标;另一方面估计任务进度值,再转成“是否取得正向进展”的二值条件。两种信号在任务后训练时输入 System 1,在推理时引导策略偏向预期会推进任务的动作。消融实验显示,两种信号联合使用通常优于单独使用:礼盒包装成功率由基础模型的 0% 提升到 80%,方块分类由 40% 提升到 55%;即便衣物折叠的成功率都已达到 100%,联合条件仍把任务分数从 68.3% 提升到 88.3%,平均时间从 107 秒降到 75 秒。

结果覆盖真实机器人、具身视觉语言和仿真基准。任务后训练的 GigaBrain-0.7 在 AgileX PiPER 与 Maker H01 上分别取得 91.5% 和 84.2% 的六任务语言跟随平均成功率,在复杂操作上分别为 84.9% 和 74.1%。它在 RoboTwin 2.0 的 Hard 设置达到 67.9%,在 EBench 达到 33.30% 成功率,并在 RoboColiseum 的四个维度均高于论文列出的公开模型。四个经验强化任务则从 SFT 平均 30.0%,经离线 RL 提升到 57.5%,再经带人工纠正的在线 RL 达到论文报告的 100%。

不过,最强数字应谨慎解读。大部分真实机器人任务每种配置仅有 10 至 20 次试验;预训练规模曲线主要以图形呈现,未报告统计置信区间;在线 RL 的 100% 来自四个特定任务,缺少试验次数、人工纠正量与跨种子方差;System 3 的世界模型被单独训练和冻结,因而“三系统统一”更准确地说是接口协同,而非完全端到端联合优化。MiMo 最终 0.5704 的检查点还使用了 MiMo 数据继续训练,作者明确把它视为诊断值而非 held-out 结果。论文证明的是一套大型工程系统能够取得广泛的系统级收益,尚未严格拆清数据规模、架构、额外计算与训练配方各自贡献多少。

1. 论文基本信息

项目内容
论文标题GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
论文编号arXiv:2608.15875
当前版本v1,2026-08-16 提交
Hugging Face 状态2026-08-26 Daily Papers 列表最顶部,详情页 dailyPaperRank: 0
作者GigaBrain Team 与 58 位作者,共 59 位署名作者
主分类Robotics(cs.RO)
核心模型System 1:PaliGemma2 3B + 0.5B Action Expert;System 2:PaliGemma2 3B;System 3:GigaWorld-1 5B
训练规模37,256.98 小时具身轨迹,16 种机器人形态,271,976,674 条 VLM 样本
评测平台AgileX PiPER/PiPER-X、Maker H01、MiMo-Embodied、RoboTwin 2.0、EBench、RoboColiseum
开放计划论文称将公开全部训练代码与预训练权重

核心链接:

2. 背景与动机:具身扩展不只是堆轨迹

2.1 VLA 的基本矛盾

Vision-Language-Action(VLA)模型把视觉观察和自然语言指令转成机器人动作,理想上能继承 VLM 的开放词汇理解,又能完成连续控制。但这两类能力的优化目标并不天然一致:

  1. VLM 关注语义、物体、空间关系和文本生成,控制策略关注高频、低误差的连续动作;
  2. 机器人轨迹来自不同机械结构、自由度、摄像头和坐标定义,动作维度不能直接共享;
  3. 只看当前帧的反应式策略难以区分“画面相似但任务阶段不同”的状态,容易重复动作;
  4. 观察到场景并生成下一步动作,并不等于能够预判动作后果或判断任务是否正在推进;
  5. 任务后训练能专门化模型,却容易受限于离线演示已经覆盖的状态,真实部署中的失败状态仍然缺少监督。

因此,论文把扩展问题拆成数据、架构与学习闭环三个层次:先对齐异构经验,再协调理解、预测与行动,最后把机器人自身 rollout 和人工纠正重新送回训练。

2.2 三类主流 VLA 架构的取舍

论文把现有 VLA 大致分为三类:

架构代表思路优势主要瓶颈
自回归 VLM-as-Actor把连续动作离散成 token,由 VLM 顺序生成语言与动作共用原生接口动作维度、频率和时域扩大后解码成本高
串联式 VLM + Action ExpertVLM 先编码,独立动作头读取最终表示模块清晰、推理可更快终层窄接口可能丢失细粒度空间信息
并行双流 MoTVLM 流与动作流逐层联合注意力语义与连续控制耦合更充分计算和推理成本更高

GigaBrain-0.7 选择第三条路线,同时不把世界模型硬塞进同一网络,而是让它作为独立 System 3 提供未来图像与价值信号。这是一种“强耦合动作、模块化预测”的折中。

3. 核心贡献

3.1 三系统架构覆盖理解、预测与控制

  • System 2:Understanding and Planning。读取当前视觉和任务指令,产生场景推理与即时子任务,把长指令分解成可执行阶段。
  • System 3:Prediction and Evaluation。根据当前观察、本体状态和子任务生成未来短视频及任务进度值,分别回答“接下来可能看到什么”和“当前是否在向目标推进”。
  • System 1:Action and Control。融合当前观察、短期视觉记忆、System 2 的子任务、本体状态、Robot ID,以及 System 3 的视觉和价值条件,输出连续动作块。

这三个系统不是同一参数集合的三个思考模式。System 1 与 System 2 在 VLA 预训练中联合优化,System 3 则从 GigaWorld-1 单独训练,任务后训练阶段保持冻结。因此,它更像由标准接口连接的模型系统,而不是完全端到端的单体网络。

3.2 统一 3.7 万小时异构具身数据

作者把数据转换到 LeRobot v3.0 格式,再统一动作顺序、状态字段、摄像头命名和元数据。缺失的自由度通过 mask 或占位维度处理;主 Action Expert 跨形态共享,输入输出投影保持具体机器人的动作定义。指令则由 GLM-5.1 统一重写,长任务进一步用多模态模型切分子任务,并通过人工抽查修正。

清洗不仅是视频质量筛选,还包括:

  1. 按机器人类型与动作维度执行 q01/q99 极值过滤,避免分位数归一化被异常值拉伸;
  2. 根据归一化状态差删除长时间静止区间;
  3. 依据 URDF 和统一基坐标修正末端执行器位姿;
  4. 用早期训练的异常 loss 反查时间错位、动作跳变、错误指令与损坏视频;
  5. 对 UMI 数据执行多摄像头、手柄位姿和夹爪状态同步,再进行逆运动学、仿真和抽样真机回放验证;
  6. 对第一视角人类视频筛除无明确手物交互、严重遮挡和无法解释的视角。

3.3 一阶段 VLA 预训练与 Soft KI

以往分阶段方案可能先训练视觉语言能力,再接动作专家。GigaBrain-0.7 从预训练开始就同时优化:

LVLA=LNTP+LFM\mathcal{L}_{\mathrm{VLA}} = \mathcal{L}_{\mathrm{NTP}} + \mathcal{L}_{\mathrm{FM}}

其中,NTP 负责语言、子任务、离散动作和通用 VLM 输出;flow matching 负责从噪声插值恢复连续动作块。为避免连续动作训练破坏 VLM,Soft KI 将回传到视觉语言骨干的动作梯度乘以 0<αKI<10 < \alpha_{\mathrm{KI}} < 1,而动作专家仍接收完整梯度。它不是完全冻结骨干,而是在“保留通用知识”和“适配具身控制”之间留下可调通道。

3.4 世界价值模型把“想象”和“评估”接入策略

System 3 分两阶段训练:先在真实机器人和仿真视频上继续预训练 GigaWorld-1,学习机器人接触和状态转移;再增加价值路径,用轨迹完成度标注监督任务进度 VtV_t

对每个动作区间,系统生成与动作块时域对齐的未来视频,把末帧 gtg_t 当作 subgoal image;同时将两个时刻的进度差离散为:

At=1[Vt+δtVt>0]A_t = \mathbb{1}\left[V_{t+\delta_t} - V_t > 0\right]

其中 At=1A_t=1 表示该动作段带来正向进展。后训练时,subgoal image 和 value condition 分别以 0.50 与 0.15 的概率独立丢弃,迫使 System 1 同时适应无条件、单条件和双条件输入;推理时固定使用正进展条件,引导模型生成与任务推进相关的行为。

3.5 离线到在线的经验强化闭环

任务演示只覆盖“人类已经做过”的状态,而实际策略会进入自己的失败分布。论文采用三步递进:

  1. SFT 建立目标任务的基础能力;
  2. 将成功、失败和部分进展 rollout 用 Advantage-Weighted Regression 重新加权,离线学习较优行为和恢复模式;
  3. 把改进后的策略重新部署,困难状态由人类直接纠正,再用 actor-critic、进度差和终局奖励在线更新。

这套闭环的意义在于:纠正数据被采集在当前策略真正卡住的位置,而不是预先猜测可能失败的状态。

4. 方法详解

4.1 数据金字塔如何分工

数据类型时长占比主要作用
真实机器人20,535.65 小时55.12%直接提供可执行连续动作监督
UMI8,251.83 小时22.15%提供近手视角、手眼协调与接触关系
EGO2,862.36 小时7.68%扩展第一视角对象、场景和人类交互先验
仿真1,453.92 小时3.90%覆盖可控、稀有或安全敏感的配置
世界模型生成4,153.22 小时11.15%扩展真实交互的视觉和上下文变化
合计37,256.98 小时100%跨来源具身轨迹

真实机器人子集包含 1,810,101 个 episode 和 2,077,837,071 帧。数据分布并不均匀:Maker H01 占 43.82% 帧,Maker M01 占 20.14%,Agibot-G1 占 18.30%,其余 13 种形态共同构成长尾。这意味着“16 种形态”不等于每种形态监督均衡,跨形态泛化仍可能被头部平台主导。

VLM 数据共 271,976,674 条,其中 15,234,327 条为团队自采,覆盖图像描述、通用 VQA、多图推理、区域定位、点预测、空间关系、机器人任务理解和 affordance。它的功能不只是让模型“会说话”,还用于抵消纯动作数据导致的语义和空间能力退化。

4.2 System 1 的双流计算

System 1 的 VLM 流保持因果自注意力;Action Expert 流则以自身 token 为 query,同时读取 VLM 和动作流的 key/value。两条流逐层共享注意力信息,但保留各自 FFN 参数。实验中,这种 Dual Stream 的推理延迟为 0.221 秒,明显高于终层交叉注意力的 0.073 秒,却在 Clean Desk、Fruit Picking、Shirt Folding 上分别达到 50%、88%、30%,而后者只有 20%、40%、0%。

模型同时保留离散与连续动作路径。离散路径通过语言头建立语义与动作的符号桥梁;真正部署使用连续 flow-matching Action Expert 输出动作块。不同机器人共享专家主体,通过 Robot ID、有效维度 mask 和形态专用投影处理自由度差异,旋转统一使用连续 6D 表示。

4.3 短期视觉记忆不是简单堆帧

Temporal-Spatial Blocks 先沿时间因果聚合历史帧,再在当前帧内进行空间交互。历史信息逐层写入当前帧表示,随后丢弃历史 token,因此送入高层 VLA 的视觉 token 数量仍接近单帧设置。训练中随机丢弃历史观察,使模型既能使用不同长度的记忆,也不会完全依赖固定窗口。

论文用定性案例展示其作用:没有时间上下文时,策略在相似视觉状态之间重复动作;加入历史后可以识别当前所处的任务阶段并跳出循环。但这里没有给出跨任务的定量平均,因而更适合视为机制示例,而不是充分的总体效果估计。

4.4 System 2 与 System 3 的接口边界

System 2 输出 chain-of-thought 式场景解释和当前子任务。论文把它用于连接长指令与低层控制,但没有报告规划正确率、分解错误类型或隐藏推理的独立消融。System 3 接收子任务后生成未来图像与进度值;它的预测时域被扩展到动作块长度之外,作者称这比 GigaBrain-0.5M* 更适合复杂任务。

这种分层有两个现实优点:世界模型可以在任务后训练阶段冻结,减少联合优化的不稳定;视觉子目标与标量进度也比完整视频更容易接入动作策略。代价是误差会沿接口传播:System 2 的子任务错误会影响 System 3 的想象,世界模型的偏差又可能引导 System 1 追逐错误未来。

5. 实验设计

5.1 研究问题与平台

实验依次考察骨干和耦合架构、数据扩展、时间上下文、System 3 条件、零样本基础能力、任务后训练、标准基准和经验强化。真实机器人包括低成本双臂 AgileX PiPER/PiPER-X,以及自研的带头部、腰部和双臂的 Maker H01。每个真实任务配置通常运行 10 至 20 次,以完整成功率为主要指标;语言任务只有选对语言指定目标并完成动作才算成功。

对照模型包括 π0.5\pi_{0.5}、GigaBrain-0.1、Xiaomi-Robotics-1 和 Galaxea G0.5。任务后训练使用对应平台的专用演示,但论文没有在结果表中逐任务列出演示数量、训练 token 或总算力,因此对比主要说明最终系统性能,而不是严格的等数据、等计算效率。

5.2 骨干选择不是单纯的参数缩放

骨干完整模型规模Clean DeskFruit PickingShirt Folding
PaliGemma23.5B50%88%30%
Qwen3.55B60%12%0%
Gemma 48.5B100%*92%0%

Gemma 4 的 Clean Desk 使用受限位置泛化设置,表中并非完全统一难度。作者最终选择 PaliGemma2,不是因为它每项最高,而是因为它在水果操作上有竞争力,并且只有它在衣物折叠上非零。这也说明,VLM 参数更多并不会自动转化为更好的连续控制。

6. 核心实验结果

6.1 System 3 消融:两种信号互补,但效果依任务而变

任务与指标Base+SubImage+Value+SubImage + Value
衣物折叠成功率100%100%100%100%
衣物折叠任务分数68.3%81.7%85.0%88.3%
衣物折叠耗时107 秒83 秒79 秒75 秒
礼盒包装成功率0%20%60%80%
礼盒包装任务分数61.1%71.4%93.3%96.7%
方块分类成功率40%50%45%55%
方块分类任务分数55.0%未单列未单列87.5%

视觉子目标和价值条件联合时总体最好,但不是每个指标都占优:方块分类中 Value-only 的成功完成平均时间最短,为 80 秒。论文由此强调 System 3 不应只看二元成功率;它也影响任务进度和执行效率。另一方面,每项只有有限试验次数,5 至 20 个百分点的差值可能对单次成败很敏感。

6.2 任务后训练:跨两种形态的真实机器人结果

评测π0.5\pi_{0.5}GigaBrain-0.1GigaBrain-0.7
PiPER 六任务语言跟随平均88.8%76.1%91.5%
H01 六任务语言跟随平均75.2%69.6%84.2%
PiPER 五项复杂操作平均76.6%64.8%84.9%
H01 七项复杂操作平均45.2%43.2%74.1%

H01 的提升最明显:食物准备与加热达到 85.0%,餐具清理与清洗达到 100.0%,而 π0.5\pi_{0.5} 分别为 50.0% 和 40.0%。但米粒清扫仍只有 45.8%,方块分类只有 41.7%,说明细粒度接触和高精度持续操作远未饱和。

零样本部分还展示了新辣椒、新葡萄、未见过的容器组合、场景变化与未见衣物的执行案例。它们支持“模型能在未专门适配时产生可执行行为”,但主要依赖图表和代表性 rollout;论文没有在正文中为所有零样本 ID/OOD 图给出可直接复核的数值表,因此不能据此估计广义开放世界成功率。

6.3 三套仿真基准

基准GigaBrain-0.7论文中的关键对照解读
RoboTwin 2.0 Easy66.8%π0.5\pi_{0.5} 70.7%干净环境并非最高
RoboTwin 2.0 Hard67.9%π0.5\pi_{0.5} 46.0%域随机化下优势明显
RoboTwin 2.0 Overall67.35%π0.5\pi_{0.5} 58.35%单个 Co-Train 多任务策略领先
EBench SR33.30%π0.5\pi_{0.5} 28.08%在正文选取的公开 VLA 中最高
EBench Score46.1π0.5\pi_{0.5} 42任务进度指标同样更高
RoboColiseum 指令跟随0.8166ACoT-VLA 0.7570四维度之一
RoboColiseum 空间推理0.4729ACoT-VLA 0.3970四维度中相对增益最大
RoboColiseum 鲁棒性0.6800ACoT-VLA 0.6220保持领先
RoboColiseum 通用操作0.6092π0.5\pi_{0.5} 0.5820保持领先

RoboTwin 的对比需注意协议:GigaBrain-0.7 与多数方法采用 50 个任务各 50 条干净演示的 Co-Train,π0\pi_0 表中则是每任务独立检查点的 Single。附录给出了 2026-08-15 的官方榜单快照,因为在线榜单之后仍可能变化。EBench 正文也只选择公开模型作简洁对照,不能把“正文表格第一”泛化为所有提交中的绝对第一。

6.4 MiMo-Embodied:作者主动划出数据污染边界

在 MiMo 数据进入训练混合物之前,GigaBrain-0.7 的 Spatial Average 为 0.5215,Affordance Average 为 0.3669,Overall 为 0.4621;其中总体和空间平均高于论文列出的对照,但 affordance 低于 G0.5-base 的 0.3956。

继续加入 MiMo 数据训练后,最终检查点 Overall 达到 0.5704。论文明确说明此时评测集不再与训练数据严格分离,因此这个值只能作为 continued-pretraining diagnostic,不能当作 held-out benchmark 成绩。最终发布的 GigaBrain-0.7 checkpoint 正是 MiMo-enhanced 阶段,实际使用者在横向比较时应保留这一条件。

6.5 经验强化:收益大,证据范围也最窄

真实机器人任务SFT离线 RL在线 RL
Link Installation(PiPER)20%40%100%
Gift Box Packing(PiPER-X)80%90%100%
Cable Tie Insertion and Tying(PiPER-X)0%40%100%
Bearing Installation(H01)20%60%100%
平均30.0%57.5%100%

阶段性提升与方法动机一致:离线 RL 从失败和部分进展中提取信号,在线阶段再针对更新后策略仍会遇到的难点进行纠正。但论文把完整 human-intervention protocol 和 online RL 公式留给未来报告,未给出每任务 rollout 数量、纠正次数、操作者成本、随机种子或置信区间。最终 100% 是四项特定任务上的报告结果,不应外推为通用真实机器人可靠性。

7. 局限与证据边界

7.1 系统组件很多,因果归因仍不充分

GigaBrain-0.7 同时改变数据规模、数据来源、骨干、双流耦合、时间记忆、Soft KI、System 3、任务后训练和强化学习。论文有局部消融,却没有用完全相同的数据和算力逐项关闭全部组件。最终领先是整个系统的联合结果,无法从现有证据判断 37K 小时数据、三系统架构或训练配方谁贡献最大。

7.2 数据规模披露充分,数据分布和治理仍有限

论文给出了细致的小时、帧和机器人类型统计,也说明了自动标注与清洗流程。但真实数据高度集中于少数自研或合作平台;世界模型生成数据占 11.15%,生成误差如何传播没有专门量化;自动重写指令和生成子任务的错误率、人工抽查比例与一致性也未公开。大规模并不自动等于无偏或高质量。

7.3 世界模型指导仍受模型偏差约束

System 3 的价值来自“先想象再评估”,但预测未来与真实物理不一致时,视觉子目标和价值信号可能共同偏向错误方向。论文展示了失败时 advantage 下降、恢复时上升的案例和下游消融,却没有系统报告视频预测误差、价值校准、OOD 失真率或错误引导的比例。

7.4 真实机器人统计强度有限

通常每项 10 至 20 次试验意味着成功率以 5 或 10 个百分点跳变。论文没有提供置信区间、显著性检验或多随机种子结果。诸如 95% 对 100%、40% 对 45% 的小差异不足以说明稳定优势;跨度几十个百分点、且在多任务重复出现的差异更有解释价值。

7.5 成本、延迟与安全仍是部署门槛

双流架构在实验中比终层交叉注意力慢约三倍,System 3 还要额外运行 5B 世界价值模型并生成未来视觉。论文报告了部分 System 1 延迟,却没有给出三系统端到端控制频率、硬件、能耗或总成本。人机共处、误动作防护、碰撞、紧急停止和失败恢复也不是本文的主要评测对象。

7.6 开放承诺与可复现状态应分开

论文使用“will be released”描述全部训练代码和预训练权重。Hugging Face 已提供 3.5B Base 模型页和示例数据页,代码仓库也已存在,但这不等于论文中的 37K 小时完整训练集、System 3 配方、全部后训练数据和真实机器人评测环境均已可重建。复现应以实际发布资产为准,而不是只依据论文承诺。

8. 应用与产业影响

8.1 通用机器人预训练底座

统一形态表示、共享 Action Expert 和形态专用投影,为“一个预训练模型适配多种机器人”提供了工程路线。它适合把昂贵的预训练能力迁移到低成本双臂、移动操作平台和人形机器人,再用较少的目标平台演示后训练。

8.2 家庭与工业长流程操作

论文覆盖整理、清洁、食物处理、装配、插接和包装等任务。System 2 的分解、System 3 的进度判断和短期视觉记忆,尤其适合动作阶段多、状态会持续变化的场景。不过,达到生产部署还需要独立的安全约束、异常检测、任务级恢复和更大规模可靠性测试。

8.3 数据生产与跨形态治理基础设施

论文真正可迁移的部分未必只是模型,而是数据管线:LeRobot v3.0 标准化、Robot ID 与 mask、URDF 对齐、UMI/EGO 转换、异常 loss 反查,以及指令与子任务统一。这些组件可帮助团队把已有的碎片化机器人数据变成可联合训练、可追踪的语料。

8.4 经验驱动的现场持续改进

离线 AWR 加在线 human correction 提供了一条现实闭环:先从生产 rollout 中学习,再只在人真正困难的状态介入。它可能降低全量遥操作采集成本,但同时带来版本回归、错误奖励、人员安全、数据权限和线上探索风险,必须配套回放评测、策略门禁与可回滚部署。

9. 相关工作与论文位置

9.1 VLA 基础路线

RT-2 和 OpenVLA 代表动作 token 的自回归路线;GR00T N1、Gemini Robotics、Qwen-RobotManip 更接近 VLM 与动作专家分离;π0\pi_0π0.5\pi_{0.5}、GigaBrain-0 系列则推动连续动作生成和大规模异构训练。GigaBrain-0.7 的直接特点是保留逐层双流耦合,同时以 Soft KI 控制动作梯度对 VLM 的影响。

9.2 世界模型与机器人策略

GigaBrain-0 把世界模型作为数据生成器,DreamGen 用生成轨迹和逆动力学扩充经验;GR-2、DreamZero、UWM、GigaWorld-Policy 更紧密地联合未来视频与动作;π0.7\pi_{0.7}、JEPA-VLA、Feat2Go 和 GigaBrain-0.5M* 则把未来表征、视觉子目标或进度值用于条件控制与优化。GigaBrain-0.7 延续最后一类思路,把视觉未来和价值评估并列为 System 3 的两个显式接口,并将其贯穿任务后训练和推理。

9.3 训练后强化与人类纠正

论文的经验强化不是从零开始在线探索,而是先 SFT、再离线优势加权、最后在更新后的策略分布上进行带纠正的在线 actor-critic。它更接近真实机器人对安全和采样成本的要求,但完整协议尚未披露,因此目前主要是有效性展示,而不是可复用的标准配方。

10. 综合判断

GigaBrain-0.7 的核心价值,是把通用机器人模型从单纯的 observation-to-action 映射扩展为“理解当前任务、想象短期未来、判断进展、执行动作、从部署经验继续学习”的完整生命周期。37K 小时异构数据和两亿多条视觉语言样本提供规模,统一表示和一阶段训练提供跨形态共享,三系统接口提供前瞻性,离线到在线强化则补上真实部署后的改进闭环。

现有证据最有说服力的部分,是跨两种真实机器人形态的任务后训练结果、System 3 在多个指标上的一致消融收益,以及三类仿真基准上的广覆盖表现。最需要保留意见的部分,是有限试验下的小幅差距、使用额外训练数据后的 MiMo 最终分数、缺少成本与置信区间的经验强化结果,以及尚未完全开放的复现链路。

因此,这篇论文更适合被理解为一份大型具身基础模型系统报告:它展示了“数据对齐 + 双流 VLA + 世界价值模型 + 经验强化”如何组合成强系统,并为跨机器人规模化提供了可操作的设计图;它还不是对三系统理论必要性、组件独立贡献或现实部署可靠性的最终证明。

参考资料

  1. GigaBrain Team, GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture, arXiv:2608.15875, 2026.
  2. Hugging Face, GigaBrain-0.7 Paper Page.
  3. GigaAI, GigaBrain-0.7 Project Page.
  4. GigaAI, GigaBrain-0 Code Repository.
  5. Open GigaAI, GigaBrain-0.7-3.5B-Base.
  6. Open GigaAI, GigaBrain-0.7 SampleData.
  7. RoboTwin, RoboTwin 2.0 Leaderboard.
  8. EBench, Official Evaluation Platform.
  9. RoboColiseum, Official Benchmark Site.