Alaya-EVOKE
Alaya-EVOKE 硅基写手基于 Hugging Face Daily Papers 2026-08-14 榜首论文,深入解析 Alaya-EVOKE 如何以相机索引几何记忆、线性扩展的长程教师和三步无 CFG 学生实现有界成本的长时交互式世界生成,并审视其基准成绩、延迟口径、记忆边界与现实应用限制。
自动研究时间:2026-08-16 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Aug 14,列表最顶部为 Alaya-EVOKE: From Linear-Scaling Supervision to Endless World。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv v1 摘要页 -> arXiv 官方 HTML 全文、PDF 与 TeX 源码 -> 官方项目与代码仓库。
执行摘要
交互式世界模型想同时做到三件事:记住已经看过的世界、立刻响应相机与文本指令、持续生成数分钟乃至数小时。传统方案常把历史帧或 KV cache 留在去噪器上下文中,导致每一步成本随会话增长;若用滑动窗口控制成本,又会丢掉已经离开窗口的场景。另一方面,为低延迟而蒸馏出的少步学生,只能继承教师在训练监督中实际展现过的时间跨度和控制能力。
Alaya-EVOKE(正文简称 Evoke)的核心判断是:长期状态不必全部塞进生成模型,长期能力也不能指望短片教师自动传给学生。 它把问题拆成两条路径:用相机位姿索引的外部几何 world state bank 保存已经观察到的空间;用专门改造的长程教师向三步学生传递抗漂移与分段文本控制能力。部署时,每次调用只处理固定短历史、当前视角可见的几何记忆和当前文本条件,因而单步上下文与位置编码范围不随会话时长增长。
方法上,学生每次生成 9 个 latent frame,对应 36 个像素帧、1.5 秒视频。教师以 Wan2.2 A14B 的 14B diffusion transformer 为基础,把序列分块;每个块只读取局部上下文、少量远帧和线性注意力全局状态,使注意力的内存与计算近似随序列长度线性增长。随后,作者在 self-forced rollout 上使用约 30 秒的全窗口 distribution matching,把长程监督和 per-chunk conditioning 蒸馏到三步、无 classifier-free guidance(CFG)的学生。
实验给出了几个有分量但必须限定口径的结果:Evoke 在 WBench navigation split 的 Video Quality、Setting 与 Physical 组均值领先所比较的少步系统;VBench-2.0 得分 66.77,VBench-Long 得分 85.11。8 条各 65.5 分钟的量化轨迹没有出现随时间持续恶化的失控趋势,另有 7 条两小时演示。但这证明的是“有界运行与未发生 runaway degradation”,不是永久的场景身份保真。长程教师在 8 个配对样本中令 7 个亮度稳定性改善,Wilcoxon ,却没有显著改善论文使用的内容描述符或清晰度。
工程上最容易被摘要掩盖的是延迟口径。论文的 2.11 秒/1.5 秒视频只统计 diffusion wall clock;附录显示几何路径另增加约 1.84 秒/块。在未做 KV cache、编译、量化或蒸馏 VAE 的 H200 实现中,完整路径仍慢于实时播放。因此,Evoke 更准确的定位是:它证明了一个不会随会话历史无限变重的世界模型架构,并把少步生成推进到接近交互速度;它还不是已经解决细粒度身份、动态物体状态和端到端实时性的“无限世界引擎”。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | Alaya-EVOKE: From Linear-Scaling Supervision to Endless World |
| 论文编号 | arXiv:2608.13546 |
| 当前版本 | v1,2026-08-13 提交 |
| Hugging Face 状态 | 2026-08-14 Daily Papers 列表最顶部、#1 Paper of the day |
| 作者 | Yuanyang Yin、Gongxuan Wang、Yifan Zhan、Chuanhao Li、Kaipeng Zhang、Feng Zhao |
| 机构 | 中国科学技术大学 BIPC 重点实验室、上海创智学院、Alaya Lab |
| 主分类 | Computer Vision and Pattern Recognition(cs.CV) |
| 学生基础模型 | Helios,逐步完成相机控制、少步化、长程蒸馏与 post-distillation |
| 教师基础模型 | 14B Wan2.2 A14B diffusion transformer,高噪声/低噪声双 expert |
| 训练数据 | Sekai 视频数据集与未公开的内部视频数据 |
| 核心机制 | 有界循环生成、外部几何 world state bank、长程交互教师、三步 CFG-free 推理 |
| 主要评测 | WBench、VBench-2.0、VBench-Long、长会话稳定性、几何回访、定时文本控制 |
| 公开资产 | 论文、代码、模型权重与示例;完整预训练数据未公开 |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2608.13546
- arXiv 摘要页:https://arxiv.org/abs/2608.13546
- arXiv HTML 全文:https://arxiv.org/html/2608.13546
- arXiv PDF:https://arxiv.org/pdf/2608.13546
- 官方项目页:https://evoke-world.github.io/Evoke/
- 官方代码仓库:https://github.com/AlayaLab/Evoke
- Hugging Face 模型权重:https://huggingface.co/AlayaLab/Evoke
2. 背景与动机:三种需求为什么互相拉扯
2.1 持久记忆会让上下文持续膨胀
交互式视频世界不是一次性生成短片。用户可能先向左转、走过一条街,再绕回原点;此时建筑、道路和物体布局应与先前一致。如果把所有过去帧或对应 KV cache 留在 denoiser 内,每个新块都要访问越来越长的历史,激活内存与计算随会话增长。若改用窗口裁剪或 cache eviction,成本虽然有界,却会遗忘窗口之外的地点。
检索式记忆与 streaming conditioning 能延长时间跨度,但最终仍受 denoiser token budget 约束。Evoke 的思路是把“已经观察到的空间事实”改存为模型外的几何状态,以相机位姿而不是时间位置寻址。这样,回到旧地点时不必把整个时间历史重新输入模型,只需渲染当前视角真正可见的旧表面。
2.2 少步学生的能力上限来自教师
互动要求低延迟,因此系统常把几十步扩散模型蒸馏成少步学生。不过,蒸馏不是凭空创造能力:如果教师只在短 clip、单个全局 prompt 上提供监督,学生就没有机会学习“几十秒后仍保持状态”或“中途加入新事件”应该是什么样。
论文把教师端的两个变量单独提出:
- 监督时间跨度:短窗口能看到曝光、饱和度、纹理等 degradation drift,却可能看不到每个局部窗口都合理、整体身份却缓慢变化的 content drift;
- 条件调度粒度:单一全局 prompt 无法展示会话中途切换指令后的正确响应,必须让不同 chunk 拥有独立文本条件。
2.3 时间漂移和空间回访不是同一个问题
论文最清晰的概念区分之一,是把两类长程不一致交给不同机制:
- 时间内容漂移来自生成分布的累积偏差,应由更长监督窗口约束;
- 空间回访不一致是某个已生成观察不再可见,应由显式存储与相机位姿检索恢复。
更长的教师窗口不能找回从未输入的旧观察,几何存储也无法决定尚未观察区域应如何合理演化。Evoke 的贡献不在于发现单一“长上下文秘诀”,而在于把两个因果来源拆开设计。
3. 核心贡献
3.1 把长会话写成固定形状的循环过程
第 步生成视频块 时,系统先按相机轨迹 从世界状态 读取当前视角的几何渲染 ,再结合固定长度历史 和当前文本条件 生成,并把新观察写回:
本地历史和世界状态都有固定预算。会话变长只增加循环次数,不增加单次调用的 token 数、位置范围和状态上限。每个 chunk 复用同一局部 RoPE 布局,也避免时间位置持续外推到训练范围之外。
3.2 把几何记忆放到 denoiser 外
学生仅保留最近 19 个 latent frame,约 3.2 秒,并分成长、中、短三档 帧。更早观察通过外部 world state bank 保存:
- 对每个新块抽取 12 帧,用单目深度模型估计深度;
- 根据已知相机内外参把深度反投影到世界空间;
- 回访时按目标视角的共可见性为历史源视图排序;
- 最多选择 8 个差异足够大的源视图,以 z-buffer 批量投影到目标视角;
- 返回 view-aligned warp 和逐像素 visibility mask。
作者不跨长序列融合深度,而是让不同 chunk 的几何独立插入,以减少单目深度尺度漂移造成的累积伪影。低于 0.5 可见度的区域被设为最大 warp noise,不向模型提供视觉信息;有支持的区域使用较低噪声,未覆盖区域则留给生成模型补全。
小时级实验把存储限制为 2160 个像素帧,即 90 秒几何;每三帧写入一帧,所以 active source pool 最多 720 帧。它提供的是保留窗口覆盖范围内的持续回忆,不是对整个会话所有地点的永久记忆。
3.3 重新设计教师,而不只压缩采样步数
Evoke Teacher 把序列划分为 9 个 latent frame 一组。每个 query chunk 访问固定来源:首帧全局 sink、带一帧重叠的局部上下文、空间压缩的近邻帧、少量选定远帧,以及通过 linear attention 累积的全局状态。单块访问量有界,因此注意力开销随序列长度近似线性而非二次增长。
教师和 critic 共用同一双 expert backbone:关闭 LoRA 时是教师,开启 LoRA 时是 critic,并根据采样 timestep 选择高噪声或低噪声 expert。分块结构同时为每个 chunk 绑定独立文本,使一条 rollout 内可以表示多次 prompt 变化。
3.4 用长窗口 self-forcing 把能力转给学生
作者在 self-forced rollout 上训练:学生后续块以自己的生成历史为条件,而非始终使用真实历史,从而暴露部署时会遇到的分布偏移。监督目标在连续 个块的窗口上衡量学生轨迹分布 与数据分布 的差异:
Evoke 使用约 30 秒、20 个学生 chunk 的 full-window distribution matching,并对 189 帧教师评分。训练同时保留有监督的 warp-conditioning 辅助目标,因为纯 distribution matching 不会直接保证相机轨迹服从性。序列并行、activation recomputation 和 chunk 级独立反向图用于控制训练成本。
3.5 三步、无 CFG 的分层推理
每个 chunk 只做三次 CFG-free denoising evaluation,依次在 、、 的 coarse-to-fine latent pyramid 上运行。几何条件只在最粗层注入,先确定大尺度空间结构,再由高分辨率阶段细化外观;visibility pruning 会去掉没有几何支持的 token。
这套设计让每一步的成本只与固定上下文及当前几何覆盖率相关,而不与已经运行了多少分钟相关。但“成本有界”不等于“成本很低”,完整延迟仍需结合第 6 节的测量口径理解。
4. 相关工作与论文位置
论文把现有方向分成三类:
| 路线 | 代表思路 | 主要矛盾 | Evoke 的处理 |
|---|---|---|---|
| denoiser 内历史 | context frame、增长 KV cache、streaming condition | 成本增长,或窗口裁剪后遗忘 | 只保留固定本地历史,把空间状态移出模型 |
| 几何外部化 | 单目深度、NeRF/3DGS、warp conditioning | 如何把回访内容稳定送回生成器 | 相机索引的有界 world state bank,读写与淘汰显式化 |
| 少步蒸馏 | progressive distillation、DMD、self-forcing | 学生只能继承教师已表达的能力 | 把监督跨度和条件调度也纳入教师设计 |
与 Genie、Genie 3、Matrix-Game、HY-GameCraft、Oasis 等交互世界模型相比,Evoke 的主要差异不是单纯延长生成时长,而是把“每一步不随时长变重”写成系统约束。与 Relic 等长记忆方法相比,它不把召回内容继续作为无限增长的模型 token,而是将已见表面渲染为当前视角的像素条件。
在训练侧,它沿用 DMD 与 self-forcing 的少步蒸馏脉络,但把教师架构视为可设计对象。论文没有声称 chunk-wise sparse attention、线性注意力或几何 warp 本身是全新发明;贡献在于围绕持久状态、长程监督与中途控制把这些机制组合成一个有界循环系统,并用控制实验验证其中一部分因果链。
5. 实验设计
5.1 模型与运行协议
- 发布学生基于 Helios,经历 camera-controllable generation、few-step inference、long-distill 和短暂 post-distill;
- 长程教师基于 14B Wan2.2 A14B;
- 默认学生每块三步、无 CFG,分辨率 ,帧率 24 fps;
- 所有运行时间在单张 H200 上测量,包含完整 VAE decoder,但没有 KV cache、编译、量化或 distilled decoder 等推理优化;
- 长会话量化实验包含 8 条各 65.5 分钟、2619 个 chunk、94,281 帧的连续轨迹;另做一条小时级一致性检查;
- world state bank 在这些实验中仅保留最近 90 秒观察。
5.2 基准和专项测试分别回答什么
- WBench navigation split:158 个相同案例,对比少步交互世界模型的视频质量、场景、导航、一致性和物理指标;
- VBench-2.0 / VBench-Long:检查少步化后一般视频质量是否明显退化;
- 长会话曲线:观察亮度、饱和度、内容描述符和单步成本是否随时间失控;
- 教师配对消融:固定蒸馏 recipe、clip、轨迹、prompt、seed 与推理参数,只改变教师时间跨度;
- 回访实验:比较保留窗口短于或覆盖离开时长时的 revisit PSNR;
- evocation 实验:在中途加入文本 clause,区分未被几何锚定和已锚定内容。
这些实验没有共同压缩成一个“无限世界分数”。它们分别验证质量、稳定、回忆和响应,证据强度也不同。
6. 核心实验结果
6.1 WBench:综合表现强,但控制项并非全面领先
在 WBench navigation split 上,Evoke 的主要组均值为:
| 组别 | Evoke | 论文中的相对位置 |
|---|---|---|
| Video Quality | 82.79 | 所比较少步系统最高 |
| Setting | 83.76 | 最高 |
| Interaction / Navigation | 78.63 | 弱于 Matrix-Game 2.0、HY-World 1.5、LingBot 系列与 Happy Oyster |
| Consistency | 86.87 | 与最强结果接近 |
| Physical | 72.06 | 最高 |
更细地看,Scene 为 74.68、Causal Fidelity 为 82.44、Geometric 为 92.68,符合外部场景状态的设计目标;但 Perspective 只有 69.74,Navigation 为 78.63。作者也把相机控制路径列为当前短板,而不是只展示平均分。
附录把 Evoke 放进不限采样预算的 WBench 公开榜单,其五组均值只领先约 0.1;且多数相邻系统用各自 many-step 默认配置,比较并非 step-matched。这个结果支持“少步模型的质量很有竞争力”,不足以证明对所有系统稳定领先。
6.2 VBench:成绩亮眼,但协议差异足以影响名次解释
| 基准 | Evoke 得分 | 表中名次 | 最接近系统 |
|---|---|---|---|
| VBench-2.0 | 66.77 | 1/10 | Veo 3:66.72 |
| VBench-Long | 85.11 | 7/10 | Veo 3:85.06;榜首 IPOW:88.26 |
Evoke 只用三步且无 CFG,而同表系统使用各自 many-step 默认采样,所以这组结果最有价值的解读是“少步并未造成明显质量崩塌”。但作者明确列出协议偏差:VBench-2.0 多数 prompt 只采一个样本、clip 为 5.875 秒、分辨率为 ,并使用 prompt augmentation;VBench-Long 也只采一个样本,clip 为 8.875 秒而非 10 秒。
单样本提高方差,长度差的控制探针估计可令 VBench-Long Total 获益约 0.02;Evoke 与 Veo 3 的差距只有 0.05。因此,VBench-2.0 第一名和 VBench-Long 对 Veo 3 的微弱领先都不应被过度解读。
6.3 长会话:证明没有失控恶化,不证明世界永久不变
8 条 65.5 分钟量化轨迹的 photometric statistics 在初始过渡后趋于稳定,active geometry pool 填满后也不再增长,单步成本保持稳定。论文还展示 7 条连续两小时的定性轨迹。
其中一条小时级轨迹的 scene-identity cosine 最终稳定在 0.523,与真实视频相隔 60 秒时对自身的相似度水平相当;opening-window shift 也远低于无关场景。作者谨慎地把它称为 stability claim,而非 fidelity claim,且图中这项长轨迹展示只有 。真实摄像机移动本就会降低内容描述符相似度,所以“曲线没有继续下坠”不等于角色、物体细节或布局被逐像素保存。
6.4 长程教师:亮度稳定因果证据较强,内容一致性证据有限
控制实验只改变教师时间跨度。短程教师学生的末段亮度稳定在起始值的 74%,长程教师学生为 101%;8 个配对 clip 中 7 个改善,Wilcoxon 。这支持长程教师能把抗 progressive photometric drift 的能力传给少步学生。
但结果没有显著区分两者的内容描述符,sharpness 也完全没有改善;post-distill 最终 checkpoint 相比 long-distill checkpoint 亦没有测得额外漂移优势。因此,证据只能落到曝光或光度稳定,不能扩张成“所有长程一致性都改善”。
附录还测试 13 种受控扰动和 5749 个训练 step:当评分窗口超过 个 chunk 后,teacher-critic detectability 变化不大,也没有统一阈值。这说明优势不是简单来自“窗口长了,所以终于看见错误”,而应归于完整教师训练过程与 rollout 分布;同时也让具体哪一项教师设计贡献最大仍未被完全拆解。
6.5 几何回访:可识别恢复,而非像素级重建
当 retention window 短于离开时长时,回访 PSNR 接近同一轨迹远端视角的 floor;一旦保留窗口覆盖离开时间,21 组比较中有 20 组出现预期跃迁,得分高 2.3–3.2 dB。最终 15.4–17.8 dB 的平台只表示旧地点变得可识别,并不代表像素精确恢复。
短时 45 度转出再返回的案例也显示:只保留最近 1.5 秒几何并没有帮助新视角,却在返回时损失 0.173 的覆盖率。可见度决定能召回多少区域的上限,未覆盖的黑带仍需模型 inpaint。
6.6 中途文本控制:能召唤新内容,但不会轻易覆盖锚点
在 48 条 schedule、每组 的测试中,中途加入的 clause 若针对未锚定空间,67% 被实现,对应同 checkpoint 的静态条件 ceiling 为 83%;若要求覆盖 source frame 或 warp history 已固定的内容,成功率只有 4%,ceiling 也只有 17%。
这说明文本控制和几何记忆形成明确优先关系:文本适合改变尚未固定的区域,已观察几何则抵抗重写。这个特性有利于场景稳定,却也意味着用户无法只靠新 prompt 任意修改旧区域。暂停 anchor 的实验没有把两组显著分开,而且会同时冻结相机,因而没有隔离出 anchor 的独立因果效应。
6.7 延迟:有界、接近交互,但尚非实时
| 口径 | 测量结果 | 应如何理解 |
|---|---|---|
| 输出视频长度 | 1.5 秒/块 | 36 像素帧,24 fps |
| diffusion wall clock | 2.11 秒/块 | 摘要与主文常引用的数字,不含完整几何路径与 I/O |
| 几何路径增量 | 约 1.84 秒/块 | 包括几何渲染、token admission 等路径开销 |
| 训练/推理优化 | 未启用 | 未使用 KV cache、编译、量化、蒸馏 decoder |
论文附录显示,开启几何路径相对跳过该路径的 recurrent step 增加约 1.84 秒;其中同时涉及几何渲染和最粗层新增 token 的 denoiser surcharge,而 2.11 秒是启用 world state bank 配置下的 diffusion wall clock,因此不能把两数无条件相加成精确的端到端延迟。可以确定的是,完整路径尚未形成 1.0 倍实时输出。几何开销会随当前视角的 warp coverage 变化,但不会随总会话时长增长。这区分了两个常被混淆的目标:Evoke 已较好解决“越跑越慢”,仍需继续解决“每一步足够快”。
7. 局限与证据边界
7.1 “Endless”是计算结构,不是无限记忆
world state bank 只有 90 秒保留预算,过期表面会被淘汰。系统可无限重复固定形状的循环,但无法永久回忆所有去过地点。论文标题里的 endless 应理解为 session length 不再要求线性膨胀的 denoiser context,而非世界状态容量无限。
7.2 当前记忆偏向静态、粗粒度几何
单目深度点云适合恢复相机运动下的静态表面,却难以保存物体身份、材质、局部纹理、遮挡关系和动态状态。人物换姿势、门开合、车辆移动后,系统需要的不只是旧表面投影,还要能更新“这个对象现在是什么状态”。论文把 object-level、semantic 和 dynamic world state 明确列为下一步。
7.3 长程教师的消融尚未完全分解机制
配对实验支持光度稳定改善,但样本仅 8 个,内容描述符和 sharpness 没有显著受益。per-chunk conditioning 提供了定时指令接口,却没有在当前样本量下与短教师显著分离 event realization。不能把全部改善简单归因于 sparse attention、30 秒窗口或分块 prompt 中的某一项。
7.4 基准比较存在非同协议与小差距
WBench 表格不是统一采样步数,VBench 也存在 clip 长度、采样数和 prompt augmentation 差异。0.05 或 0.1 量级的榜单优势与协议噪声同阶。论文对此披露充分,但传播时如果只保留“第一名”,就会丢失最重要的限制条件。
7.5 复现仍受数据与算力约束
代码、多个阶段 checkpoint、教师和推理脚本已经公开,仓库使用 Apache-2.0;但训练还依赖 Sekai 与额外内部视频,仓库只附带一个 60 秒示例 clip 作为 pipeline check,不能重现正式训练数据分布。long-distill 使用 GPU、1981 steps,完整复现实验成本高;必需的 ViGeo 深度权重使用更严格的 CC-BY-NC-4.0,也会影响商业使用。
7.6 世界视频合理不等于物理世界模型正确
WBench、VBench 与视觉曲线主要判断画面质量、连续性、控制响应和部分物理合理性。它们没有证明模型形成可用于长期规划的因果状态、严格守恒的动力学,或在机器人闭环中可安全预测真实结果。Evoke 是高质量交互式生成器与视觉模拟基础,不应直接等同于可靠物理仿真器。
8. 应用影响
8.1 交互内容创作
对游戏预演、虚拟摄影和分镜探索,固定成本循环与中途 prompt schedule 比一次性长视频更实用。用户可以持续移动相机,在未锚定区域召唤天气、天空事件或新物体,同时让已观察建筑保持相对稳定。限制是旧区域难以通过纯文本覆盖,编辑器需要显式“解除锚定”或局部状态编辑接口。
8.2 机器人与 embodied agent 数据生成
相机控制、回访和长轨迹让 Evoke 有潜力生成导航或操作训练素材,特别适合用作视觉 domain randomization 和策略压力测试的内容层。但当前动态状态与物理忠实度不足,不能替代带真值动力学的模拟器。更现实的组合是让物理引擎维护可验证状态,Evoke 负责高真实感渲染与开放场景变化。
8.3 世界模型系统架构
论文最可迁移的思想是“外部显式状态 + 有限模型上下文”。这与 Agent 系统把长期记忆、数据库和工具状态移出 LLM context 的工程原则相似:模型只读取当前决策相关的视图,外部系统负责寻址、版本与淘汰。区别在于 Evoke 用相机几何定义相关性,而语言 Agent 通常依赖语义检索和权限规则。
8.4 推理基础设施
未来优化空间也很具体:更高压缩比 VAE、更高效的少步生成器、缓存与编译、量化,以及更便宜的深度估计和 warp pipeline。由于状态与单步接口已经有界,这些优化不需要先解决无限历史增长问题,更容易形成可预估的服务容量与延迟预算。
9. 综合判断
Alaya-EVOKE 的价值不在“生成了两小时视频”这一演示本身,而在于把长时交互拆成了三个可检验的系统约束:
- 状态有界:长期空间记忆由外部几何 bank 管理,denoiser 不背负整段历史;
- 监督够长:教师必须在训练中真实暴露长程漂移和中途条件变化;
- 部署少步:学生以三步、无 CFG 的固定接口反复运行。
现有结果支持这个架构能够避免上下文与单步成本随会话线性增长,并在少步条件下保持强视频质量。几何回访和光度稳定实验也分别为外部记忆与长程教师提供了比纯演示更扎实的证据。
但论文离“无限、实时、物理可信的世界”仍有三段距离:记忆窗口有限且偏静态粗几何,完整端到端速度慢于实时,长期身份与动力学没有被充分验证。最准确的结论是:Evoke 给出了一个可信的有界长会话底座,并证明教师设计会限制少步世界模型的长程上限;下一阶段的竞争将从单纯延长视频,转向可更新的对象状态、更严格的长程评测和真正端到端实时。
参考资料
- Hugging Face Papers:Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
- arXiv:摘要页与版本信息
- arXiv:官方 HTML 全文
- arXiv:官方 PDF
- Alaya Lab:Evoke 官方项目页
- GitHub:AlayaLab/Evoke 官方实现
- Hugging Face:AlayaLab/Evoke 模型权重