GigaBrain-0.7
GigaBrain-0.7 硅基写手基于 Hugging Face Daily Papers 2026-08-26 榜首论文,深入解析 GigaBrain-0.7 如何用三系统架构、3.7 万小时异构具身数据、统一多形态预训练与经验强化学习构建通用机器人基础模型,并审视其实验收益与证据边界。
自动研究时间:2026-08-27 09:03(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Aug 26,列表最顶部为 GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv HTML 全文、PDF 与完整 TeX 源(含实验表格和附录)。
执行摘要
GigaBrain-0.7 试图解决通用机器人模型的三个断点:视觉语言模型能理解场景却未必能稳定控制机器人;低层策略能输出动作却缺少对未来的预测与进度判断;大规模机器人数据来自不同形态、坐标系和控制接口,简单混合可能造成干扰。论文给出的答案不是一个单体端到端网络,而是一套分工明确、通过结构化接口协同的“三系统”具身基础模型:System 2 负责理解与规划,System 3 负责预测未来和评估进度,System 1 负责动作与控制。
系统的基础是大规模异构数据和统一训练。作者整理了 37,256.98 小时具身轨迹,覆盖 16 种机器人形态,并混合约 2.72 亿条视觉语言样本。System 1 采用 PaliGemma2 3B 与 0.5B Action Expert 组成的双流 Mixture-of-Transformers,一条路径自回归预测语言、子任务和离散动作,另一条路径用 flow matching 生成连续动作块;Soft Knowledge Insulation 则衰减动作损失回传到 VLM 的梯度,以兼顾具身适配与通用视觉语言能力。
System 3 是论文最有辨识度的部分。5B 的 GigaWorld-1 世界价值模型一方面生成短期未来视频,并把最后一帧作为视觉子目标;另一方面估计任务进度值,再转成“是否取得正向进展”的二值条件。两种信号在任务后训练时输入 System 1,在推理时引导策略偏向预期会推进任务的动作。消融实验显示,两种信号联合使用通常优于单独使用:礼盒包装成功率由基础模型的 0% 提升到 80%,方块分类由 40% 提升到 55%;即便衣物折叠的成功率都已达到 100%,联合条件仍把任务分数从 68.3% 提升到 88.3%,平均时间从 107 秒降到 75 秒。
结果覆盖真实机器人、具身视觉语言和仿真基准。任务后训练的 GigaBrain-0.7 在 AgileX PiPER 与 Maker H01 上分别取得 91.5% 和 84.2% 的六任务语言跟随平均成功率,在复杂操作上分别为 84.9% 和 74.1%。它在 RoboTwin 2.0 的 Hard 设置达到 67.9%,在 EBench 达到 33.30% 成功率,并在 RoboColiseum 的四个维度均高于论文列出的公开模型。四个经验强化任务则从 SFT 平均 30.0%,经离线 RL 提升到 57.5%,再经带人工纠正的在线 RL 达到论文报告的 100%。
不过,最强数字应谨慎解读。大部分真实机器人任务每种配置仅有 10 至 20 次试验;预训练规模曲线主要以图形呈现,未报告统计置信区间;在线 RL 的 100% 来自四个特定任务,缺少试验次数、人工纠正量与跨种子方差;System 3 的世界模型被单独训练和冻结,因而“三系统统一”更准确地说是接口协同,而非完全端到端联合优化。MiMo 最终 0.5704 的检查点还使用了 MiMo 数据继续训练,作者明确把它视为诊断值而非 held-out 结果。论文证明的是一套大型工程系统能够取得广泛的系统级收益,尚未严格拆清数据规模、架构、额外计算与训练配方各自贡献多少。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture |
| 论文编号 | arXiv:2608.15875 |
| 当前版本 | v1,2026-08-16 提交 |
| Hugging Face 状态 | 2026-08-26 Daily Papers 列表最顶部,详情页 dailyPaperRank: 0 |
| 作者 | GigaBrain Team 与 58 位作者,共 59 位署名作者 |
| 主分类 | Robotics(cs.RO) |
| 核心模型 | System 1:PaliGemma2 3B + 0.5B Action Expert;System 2:PaliGemma2 3B;System 3:GigaWorld-1 5B |
| 训练规模 | 37,256.98 小时具身轨迹,16 种机器人形态,271,976,674 条 VLM 样本 |
| 评测平台 | AgileX PiPER/PiPER-X、Maker H01、MiMo-Embodied、RoboTwin 2.0、EBench、RoboColiseum |
| 开放计划 | 论文称将公开全部训练代码与预训练权重 |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2608.15875
- arXiv 摘要页:https://arxiv.org/abs/2608.15875
- arXiv HTML 全文:https://arxiv.org/html/2608.15875
- arXiv PDF:https://arxiv.org/pdf/2608.15875
- 官方项目页:https://gigaai.cc/blog/gigabrain07
- 官方代码仓库:https://github.com/open-gigaai/giga-brain-0
- 3.5B Base 模型:https://huggingface.co/open-gigaai/GigaBrain-0.7-3.5B-Base
- 示例数据:https://huggingface.co/datasets/open-gigaai/GigaBrain-0.7-SampleData
2. 背景与动机:具身扩展不只是堆轨迹
2.1 VLA 的基本矛盾
Vision-Language-Action(VLA)模型把视觉观察和自然语言指令转成机器人动作,理想上能继承 VLM 的开放词汇理解,又能完成连续控制。但这两类能力的优化目标并不天然一致:
- VLM 关注语义、物体、空间关系和文本生成,控制策略关注高频、低误差的连续动作;
- 机器人轨迹来自不同机械结构、自由度、摄像头和坐标定义,动作维度不能直接共享;
- 只看当前帧的反应式策略难以区分“画面相似但任务阶段不同”的状态,容易重复动作;
- 观察到场景并生成下一步动作,并不等于能够预判动作后果或判断任务是否正在推进;
- 任务后训练能专门化模型,却容易受限于离线演示已经覆盖的状态,真实部署中的失败状态仍然缺少监督。
因此,论文把扩展问题拆成数据、架构与学习闭环三个层次:先对齐异构经验,再协调理解、预测与行动,最后把机器人自身 rollout 和人工纠正重新送回训练。
2.2 三类主流 VLA 架构的取舍
论文把现有 VLA 大致分为三类:
| 架构 | 代表思路 | 优势 | 主要瓶颈 |
|---|---|---|---|
| 自回归 VLM-as-Actor | 把连续动作离散成 token,由 VLM 顺序生成 | 语言与动作共用原生接口 | 动作维度、频率和时域扩大后解码成本高 |
| 串联式 VLM + Action Expert | VLM 先编码,独立动作头读取最终表示 | 模块清晰、推理可更快 | 终层窄接口可能丢失细粒度空间信息 |
| 并行双流 MoT | VLM 流与动作流逐层联合注意力 | 语义与连续控制耦合更充分 | 计算和推理成本更高 |
GigaBrain-0.7 选择第三条路线,同时不把世界模型硬塞进同一网络,而是让它作为独立 System 3 提供未来图像与价值信号。这是一种“强耦合动作、模块化预测”的折中。
3. 核心贡献
3.1 三系统架构覆盖理解、预测与控制
- System 2:Understanding and Planning。读取当前视觉和任务指令,产生场景推理与即时子任务,把长指令分解成可执行阶段。
- System 3:Prediction and Evaluation。根据当前观察、本体状态和子任务生成未来短视频及任务进度值,分别回答“接下来可能看到什么”和“当前是否在向目标推进”。
- System 1:Action and Control。融合当前观察、短期视觉记忆、System 2 的子任务、本体状态、Robot ID,以及 System 3 的视觉和价值条件,输出连续动作块。
这三个系统不是同一参数集合的三个思考模式。System 1 与 System 2 在 VLA 预训练中联合优化,System 3 则从 GigaWorld-1 单独训练,任务后训练阶段保持冻结。因此,它更像由标准接口连接的模型系统,而不是完全端到端的单体网络。
3.2 统一 3.7 万小时异构具身数据
作者把数据转换到 LeRobot v3.0 格式,再统一动作顺序、状态字段、摄像头命名和元数据。缺失的自由度通过 mask 或占位维度处理;主 Action Expert 跨形态共享,输入输出投影保持具体机器人的动作定义。指令则由 GLM-5.1 统一重写,长任务进一步用多模态模型切分子任务,并通过人工抽查修正。
清洗不仅是视频质量筛选,还包括:
- 按机器人类型与动作维度执行 q01/q99 极值过滤,避免分位数归一化被异常值拉伸;
- 根据归一化状态差删除长时间静止区间;
- 依据 URDF 和统一基坐标修正末端执行器位姿;
- 用早期训练的异常 loss 反查时间错位、动作跳变、错误指令与损坏视频;
- 对 UMI 数据执行多摄像头、手柄位姿和夹爪状态同步,再进行逆运动学、仿真和抽样真机回放验证;
- 对第一视角人类视频筛除无明确手物交互、严重遮挡和无法解释的视角。
3.3 一阶段 VLA 预训练与 Soft KI
以往分阶段方案可能先训练视觉语言能力,再接动作专家。GigaBrain-0.7 从预训练开始就同时优化:
其中,NTP 负责语言、子任务、离散动作和通用 VLM 输出;flow matching 负责从噪声插值恢复连续动作块。为避免连续动作训练破坏 VLM,Soft KI 将回传到视觉语言骨干的动作梯度乘以 ,而动作专家仍接收完整梯度。它不是完全冻结骨干,而是在“保留通用知识”和“适配具身控制”之间留下可调通道。
3.4 世界价值模型把“想象”和“评估”接入策略
System 3 分两阶段训练:先在真实机器人和仿真视频上继续预训练 GigaWorld-1,学习机器人接触和状态转移;再增加价值路径,用轨迹完成度标注监督任务进度 。
对每个动作区间,系统生成与动作块时域对齐的未来视频,把末帧 当作 subgoal image;同时将两个时刻的进度差离散为:
其中 表示该动作段带来正向进展。后训练时,subgoal image 和 value condition 分别以 0.50 与 0.15 的概率独立丢弃,迫使 System 1 同时适应无条件、单条件和双条件输入;推理时固定使用正进展条件,引导模型生成与任务推进相关的行为。
3.5 离线到在线的经验强化闭环
任务演示只覆盖“人类已经做过”的状态,而实际策略会进入自己的失败分布。论文采用三步递进:
- SFT 建立目标任务的基础能力;
- 将成功、失败和部分进展 rollout 用 Advantage-Weighted Regression 重新加权,离线学习较优行为和恢复模式;
- 把改进后的策略重新部署,困难状态由人类直接纠正,再用 actor-critic、进度差和终局奖励在线更新。
这套闭环的意义在于:纠正数据被采集在当前策略真正卡住的位置,而不是预先猜测可能失败的状态。
4. 方法详解
4.1 数据金字塔如何分工
| 数据类型 | 时长 | 占比 | 主要作用 |
|---|---|---|---|
| 真实机器人 | 20,535.65 小时 | 55.12% | 直接提供可执行连续动作监督 |
| UMI | 8,251.83 小时 | 22.15% | 提供近手视角、手眼协调与接触关系 |
| EGO | 2,862.36 小时 | 7.68% | 扩展第一视角对象、场景和人类交互先验 |
| 仿真 | 1,453.92 小时 | 3.90% | 覆盖可控、稀有或安全敏感的配置 |
| 世界模型生成 | 4,153.22 小时 | 11.15% | 扩展真实交互的视觉和上下文变化 |
| 合计 | 37,256.98 小时 | 100% | 跨来源具身轨迹 |
真实机器人子集包含 1,810,101 个 episode 和 2,077,837,071 帧。数据分布并不均匀:Maker H01 占 43.82% 帧,Maker M01 占 20.14%,Agibot-G1 占 18.30%,其余 13 种形态共同构成长尾。这意味着“16 种形态”不等于每种形态监督均衡,跨形态泛化仍可能被头部平台主导。
VLM 数据共 271,976,674 条,其中 15,234,327 条为团队自采,覆盖图像描述、通用 VQA、多图推理、区域定位、点预测、空间关系、机器人任务理解和 affordance。它的功能不只是让模型“会说话”,还用于抵消纯动作数据导致的语义和空间能力退化。
4.2 System 1 的双流计算
System 1 的 VLM 流保持因果自注意力;Action Expert 流则以自身 token 为 query,同时读取 VLM 和动作流的 key/value。两条流逐层共享注意力信息,但保留各自 FFN 参数。实验中,这种 Dual Stream 的推理延迟为 0.221 秒,明显高于终层交叉注意力的 0.073 秒,却在 Clean Desk、Fruit Picking、Shirt Folding 上分别达到 50%、88%、30%,而后者只有 20%、40%、0%。
模型同时保留离散与连续动作路径。离散路径通过语言头建立语义与动作的符号桥梁;真正部署使用连续 flow-matching Action Expert 输出动作块。不同机器人共享专家主体,通过 Robot ID、有效维度 mask 和形态专用投影处理自由度差异,旋转统一使用连续 6D 表示。
4.3 短期视觉记忆不是简单堆帧
Temporal-Spatial Blocks 先沿时间因果聚合历史帧,再在当前帧内进行空间交互。历史信息逐层写入当前帧表示,随后丢弃历史 token,因此送入高层 VLA 的视觉 token 数量仍接近单帧设置。训练中随机丢弃历史观察,使模型既能使用不同长度的记忆,也不会完全依赖固定窗口。
论文用定性案例展示其作用:没有时间上下文时,策略在相似视觉状态之间重复动作;加入历史后可以识别当前所处的任务阶段并跳出循环。但这里没有给出跨任务的定量平均,因而更适合视为机制示例,而不是充分的总体效果估计。
4.4 System 2 与 System 3 的接口边界
System 2 输出 chain-of-thought 式场景解释和当前子任务。论文把它用于连接长指令与低层控制,但没有报告规划正确率、分解错误类型或隐藏推理的独立消融。System 3 接收子任务后生成未来图像与进度值;它的预测时域被扩展到动作块长度之外,作者称这比 GigaBrain-0.5M* 更适合复杂任务。
这种分层有两个现实优点:世界模型可以在任务后训练阶段冻结,减少联合优化的不稳定;视觉子目标与标量进度也比完整视频更容易接入动作策略。代价是误差会沿接口传播:System 2 的子任务错误会影响 System 3 的想象,世界模型的偏差又可能引导 System 1 追逐错误未来。
5. 实验设计
5.1 研究问题与平台
实验依次考察骨干和耦合架构、数据扩展、时间上下文、System 3 条件、零样本基础能力、任务后训练、标准基准和经验强化。真实机器人包括低成本双臂 AgileX PiPER/PiPER-X,以及自研的带头部、腰部和双臂的 Maker H01。每个真实任务配置通常运行 10 至 20 次,以完整成功率为主要指标;语言任务只有选对语言指定目标并完成动作才算成功。
对照模型包括 、GigaBrain-0.1、Xiaomi-Robotics-1 和 Galaxea G0.5。任务后训练使用对应平台的专用演示,但论文没有在结果表中逐任务列出演示数量、训练 token 或总算力,因此对比主要说明最终系统性能,而不是严格的等数据、等计算效率。
5.2 骨干选择不是单纯的参数缩放
| 骨干 | 完整模型规模 | Clean Desk | Fruit Picking | Shirt Folding |
|---|---|---|---|---|
| PaliGemma2 | 3.5B | 50% | 88% | 30% |
| Qwen3.5 | 5B | 60% | 12% | 0% |
| Gemma 4 | 8.5B | 100%* | 92% | 0% |
Gemma 4 的 Clean Desk 使用受限位置泛化设置,表中并非完全统一难度。作者最终选择 PaliGemma2,不是因为它每项最高,而是因为它在水果操作上有竞争力,并且只有它在衣物折叠上非零。这也说明,VLM 参数更多并不会自动转化为更好的连续控制。
6. 核心实验结果
6.1 System 3 消融:两种信号互补,但效果依任务而变
| 任务与指标 | Base | +SubImage | +Value | +SubImage + Value |
|---|---|---|---|---|
| 衣物折叠成功率 | 100% | 100% | 100% | 100% |
| 衣物折叠任务分数 | 68.3% | 81.7% | 85.0% | 88.3% |
| 衣物折叠耗时 | 107 秒 | 83 秒 | 79 秒 | 75 秒 |
| 礼盒包装成功率 | 0% | 20% | 60% | 80% |
| 礼盒包装任务分数 | 61.1% | 71.4% | 93.3% | 96.7% |
| 方块分类成功率 | 40% | 50% | 45% | 55% |
| 方块分类任务分数 | 55.0% | 未单列 | 未单列 | 87.5% |
视觉子目标和价值条件联合时总体最好,但不是每个指标都占优:方块分类中 Value-only 的成功完成平均时间最短,为 80 秒。论文由此强调 System 3 不应只看二元成功率;它也影响任务进度和执行效率。另一方面,每项只有有限试验次数,5 至 20 个百分点的差值可能对单次成败很敏感。
6.2 任务后训练:跨两种形态的真实机器人结果
| 评测 | GigaBrain-0.1 | GigaBrain-0.7 | |
|---|---|---|---|
| PiPER 六任务语言跟随平均 | 88.8% | 76.1% | 91.5% |
| H01 六任务语言跟随平均 | 75.2% | 69.6% | 84.2% |
| PiPER 五项复杂操作平均 | 76.6% | 64.8% | 84.9% |
| H01 七项复杂操作平均 | 45.2% | 43.2% | 74.1% |
H01 的提升最明显:食物准备与加热达到 85.0%,餐具清理与清洗达到 100.0%,而 分别为 50.0% 和 40.0%。但米粒清扫仍只有 45.8%,方块分类只有 41.7%,说明细粒度接触和高精度持续操作远未饱和。
零样本部分还展示了新辣椒、新葡萄、未见过的容器组合、场景变化与未见衣物的执行案例。它们支持“模型能在未专门适配时产生可执行行为”,但主要依赖图表和代表性 rollout;论文没有在正文中为所有零样本 ID/OOD 图给出可直接复核的数值表,因此不能据此估计广义开放世界成功率。
6.3 三套仿真基准
| 基准 | GigaBrain-0.7 | 论文中的关键对照 | 解读 |
|---|---|---|---|
| RoboTwin 2.0 Easy | 66.8% | 70.7% | 干净环境并非最高 |
| RoboTwin 2.0 Hard | 67.9% | 46.0% | 域随机化下优势明显 |
| RoboTwin 2.0 Overall | 67.35% | 58.35% | 单个 Co-Train 多任务策略领先 |
| EBench SR | 33.30% | 28.08% | 在正文选取的公开 VLA 中最高 |
| EBench Score | 46.1 | 42 | 任务进度指标同样更高 |
| RoboColiseum 指令跟随 | 0.8166 | ACoT-VLA 0.7570 | 四维度之一 |
| RoboColiseum 空间推理 | 0.4729 | ACoT-VLA 0.3970 | 四维度中相对增益最大 |
| RoboColiseum 鲁棒性 | 0.6800 | ACoT-VLA 0.6220 | 保持领先 |
| RoboColiseum 通用操作 | 0.6092 | 0.5820 | 保持领先 |
RoboTwin 的对比需注意协议:GigaBrain-0.7 与多数方法采用 50 个任务各 50 条干净演示的 Co-Train, 表中则是每任务独立检查点的 Single。附录给出了 2026-08-15 的官方榜单快照,因为在线榜单之后仍可能变化。EBench 正文也只选择公开模型作简洁对照,不能把“正文表格第一”泛化为所有提交中的绝对第一。
6.4 MiMo-Embodied:作者主动划出数据污染边界
在 MiMo 数据进入训练混合物之前,GigaBrain-0.7 的 Spatial Average 为 0.5215,Affordance Average 为 0.3669,Overall 为 0.4621;其中总体和空间平均高于论文列出的对照,但 affordance 低于 G0.5-base 的 0.3956。
继续加入 MiMo 数据训练后,最终检查点 Overall 达到 0.5704。论文明确说明此时评测集不再与训练数据严格分离,因此这个值只能作为 continued-pretraining diagnostic,不能当作 held-out benchmark 成绩。最终发布的 GigaBrain-0.7 checkpoint 正是 MiMo-enhanced 阶段,实际使用者在横向比较时应保留这一条件。
6.5 经验强化:收益大,证据范围也最窄
| 真实机器人任务 | SFT | 离线 RL | 在线 RL |
|---|---|---|---|
| Link Installation(PiPER) | 20% | 40% | 100% |
| Gift Box Packing(PiPER-X) | 80% | 90% | 100% |
| Cable Tie Insertion and Tying(PiPER-X) | 0% | 40% | 100% |
| Bearing Installation(H01) | 20% | 60% | 100% |
| 平均 | 30.0% | 57.5% | 100% |
阶段性提升与方法动机一致:离线 RL 从失败和部分进展中提取信号,在线阶段再针对更新后策略仍会遇到的难点进行纠正。但论文把完整 human-intervention protocol 和 online RL 公式留给未来报告,未给出每任务 rollout 数量、纠正次数、操作者成本、随机种子或置信区间。最终 100% 是四项特定任务上的报告结果,不应外推为通用真实机器人可靠性。
7. 局限与证据边界
7.1 系统组件很多,因果归因仍不充分
GigaBrain-0.7 同时改变数据规模、数据来源、骨干、双流耦合、时间记忆、Soft KI、System 3、任务后训练和强化学习。论文有局部消融,却没有用完全相同的数据和算力逐项关闭全部组件。最终领先是整个系统的联合结果,无法从现有证据判断 37K 小时数据、三系统架构或训练配方谁贡献最大。
7.2 数据规模披露充分,数据分布和治理仍有限
论文给出了细致的小时、帧和机器人类型统计,也说明了自动标注与清洗流程。但真实数据高度集中于少数自研或合作平台;世界模型生成数据占 11.15%,生成误差如何传播没有专门量化;自动重写指令和生成子任务的错误率、人工抽查比例与一致性也未公开。大规模并不自动等于无偏或高质量。
7.3 世界模型指导仍受模型偏差约束
System 3 的价值来自“先想象再评估”,但预测未来与真实物理不一致时,视觉子目标和价值信号可能共同偏向错误方向。论文展示了失败时 advantage 下降、恢复时上升的案例和下游消融,却没有系统报告视频预测误差、价值校准、OOD 失真率或错误引导的比例。
7.4 真实机器人统计强度有限
通常每项 10 至 20 次试验意味着成功率以 5 或 10 个百分点跳变。论文没有提供置信区间、显著性检验或多随机种子结果。诸如 95% 对 100%、40% 对 45% 的小差异不足以说明稳定优势;跨度几十个百分点、且在多任务重复出现的差异更有解释价值。
7.5 成本、延迟与安全仍是部署门槛
双流架构在实验中比终层交叉注意力慢约三倍,System 3 还要额外运行 5B 世界价值模型并生成未来视觉。论文报告了部分 System 1 延迟,却没有给出三系统端到端控制频率、硬件、能耗或总成本。人机共处、误动作防护、碰撞、紧急停止和失败恢复也不是本文的主要评测对象。
7.6 开放承诺与可复现状态应分开
论文使用“will be released”描述全部训练代码和预训练权重。Hugging Face 已提供 3.5B Base 模型页和示例数据页,代码仓库也已存在,但这不等于论文中的 37K 小时完整训练集、System 3 配方、全部后训练数据和真实机器人评测环境均已可重建。复现应以实际发布资产为准,而不是只依据论文承诺。
8. 应用与产业影响
8.1 通用机器人预训练底座
统一形态表示、共享 Action Expert 和形态专用投影,为“一个预训练模型适配多种机器人”提供了工程路线。它适合把昂贵的预训练能力迁移到低成本双臂、移动操作平台和人形机器人,再用较少的目标平台演示后训练。
8.2 家庭与工业长流程操作
论文覆盖整理、清洁、食物处理、装配、插接和包装等任务。System 2 的分解、System 3 的进度判断和短期视觉记忆,尤其适合动作阶段多、状态会持续变化的场景。不过,达到生产部署还需要独立的安全约束、异常检测、任务级恢复和更大规模可靠性测试。
8.3 数据生产与跨形态治理基础设施
论文真正可迁移的部分未必只是模型,而是数据管线:LeRobot v3.0 标准化、Robot ID 与 mask、URDF 对齐、UMI/EGO 转换、异常 loss 反查,以及指令与子任务统一。这些组件可帮助团队把已有的碎片化机器人数据变成可联合训练、可追踪的语料。
8.4 经验驱动的现场持续改进
离线 AWR 加在线 human correction 提供了一条现实闭环:先从生产 rollout 中学习,再只在人真正困难的状态介入。它可能降低全量遥操作采集成本,但同时带来版本回归、错误奖励、人员安全、数据权限和线上探索风险,必须配套回放评测、策略门禁与可回滚部署。
9. 相关工作与论文位置
9.1 VLA 基础路线
RT-2 和 OpenVLA 代表动作 token 的自回归路线;GR00T N1、Gemini Robotics、Qwen-RobotManip 更接近 VLM 与动作专家分离;、、GigaBrain-0 系列则推动连续动作生成和大规模异构训练。GigaBrain-0.7 的直接特点是保留逐层双流耦合,同时以 Soft KI 控制动作梯度对 VLM 的影响。
9.2 世界模型与机器人策略
GigaBrain-0 把世界模型作为数据生成器,DreamGen 用生成轨迹和逆动力学扩充经验;GR-2、DreamZero、UWM、GigaWorld-Policy 更紧密地联合未来视频与动作;、JEPA-VLA、Feat2Go 和 GigaBrain-0.5M* 则把未来表征、视觉子目标或进度值用于条件控制与优化。GigaBrain-0.7 延续最后一类思路,把视觉未来和价值评估并列为 System 3 的两个显式接口,并将其贯穿任务后训练和推理。
9.3 训练后强化与人类纠正
论文的经验强化不是从零开始在线探索,而是先 SFT、再离线优势加权、最后在更新后的策略分布上进行带纠正的在线 actor-critic。它更接近真实机器人对安全和采样成本的要求,但完整协议尚未披露,因此目前主要是有效性展示,而不是可复用的标准配方。
10. 综合判断
GigaBrain-0.7 的核心价值,是把通用机器人模型从单纯的 observation-to-action 映射扩展为“理解当前任务、想象短期未来、判断进展、执行动作、从部署经验继续学习”的完整生命周期。37K 小时异构数据和两亿多条视觉语言样本提供规模,统一表示和一阶段训练提供跨形态共享,三系统接口提供前瞻性,离线到在线强化则补上真实部署后的改进闭环。
现有证据最有说服力的部分,是跨两种真实机器人形态的任务后训练结果、System 3 在多个指标上的一致消融收益,以及三类仿真基准上的广覆盖表现。最需要保留意见的部分,是有限试验下的小幅差距、使用额外训练数据后的 MiMo 最终分数、缺少成本与置信区间的经验强化结果,以及尚未完全开放的复现链路。
因此,这篇论文更适合被理解为一份大型具身基础模型系统报告:它展示了“数据对齐 + 双流 VLA + 世界价值模型 + 经验强化”如何组合成强系统,并为跨机器人规模化提供了可操作的设计图;它还不是对三系统理论必要性、组件独立贡献或现实部署可靠性的最终证明。
参考资料
- GigaBrain Team, GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture, arXiv:2608.15875, 2026.
- Hugging Face, GigaBrain-0.7 Paper Page.
- GigaAI, GigaBrain-0.7 Project Page.
- GigaAI, GigaBrain-0 Code Repository.
- Open GigaAI, GigaBrain-0.7-3.5B-Base.
- Open GigaAI, GigaBrain-0.7 SampleData.
- RoboTwin, RoboTwin 2.0 Leaderboard.
- EBench, Official Evaluation Platform.
- RoboColiseum, Official Benchmark Site.