热心市民王先生

Introducing OpenAI Presence

#企业AI #AI Agent #语音代理 #聊天代理

OpenAI 推出经过实战检验的企业 AI 代理平台 Presence,帮助部署受信任的语音与聊天代理,处理客户服务和内部工作流。

概述

OpenAI 于 2026 年 7 月 22 日正式推出企业级 AI 代理平台 Presence。该产品并非单纯的对话模型,而是一整套将 AI 代理可靠地嵌入高价值客户服务与内部工作流的生产系统。Presence 已在多家领先企业经过多年验证与打磨,支持实时语音和聊天两种交互渠道,可处理计费争议、保险理赔、内部 IT 工单等具体业务场景。其核心设计理念是“以信任为基础,在部署前、中、后全程可控”,通过策略、护栏、模拟评估以及 Codex 驱动的持续改进回路,使代理在动态业务环境中始终保持准确、合规并能安全升级给人工。OpenAI 将以有限普遍可用(limited GA)的形式向合资格的企业客户提供 Presence,部署工作由前沿部署工程师及全球系统集成商主导,暂不支持自助服务。

背景与问题

传统客服与内部自动化面临着成本高、一致性差、难以快速适应政策及用户行为变化等挑战。随着大语言模型能力提升,企业尝试将其用于客服等场景,但很快从“概念验证”进入了真正的“生产落地困境”。核心矛盾从“AI 能否完成某项任务”转变为:“AI 能否在持续变化的业务规则、产品策略和客户行为下稳定、安全地执行高价值工作,并且企业能够保持对过程的完全掌控”。这要求产品不仅包含底层模型推理能力,还必须有一套能够不断学习、评估和修正代理行为的工程系统与治理机制。OpenAI 正是基于与众多客户合作中积累的经验,将此类能力固化为 Presence 产品,旨在解决这一过渡期难题。

核心内容解析

产品定位与工作原理

Presence 的目标是为每一个代理分配一个具体的“工作”,例如解决账单纠纷、支持保险理赔或处理员工 IT 请求。部署时企业只向代理注入完成该工作所需的知识与系统权限,并明确其行为边界:哪些动作可自动执行、何时需要请求人工审批、何时必须直接升级给人类专员。启动后进入持续优化阶段,通过分析真实会话和升级记录,发现知识与策略盲区,再由 Codex(产品内置的改进引擎)提出可测试、可审批的更新方案,最终实现受控发布。

整个过程并非一次性交付,而是 OpenAI 团队(尤其是其前沿部署工程师 FDEs)与客户紧密协作,逐步识别高价值任务、对接必要的企业系统与知识库、建立权责策略、执行压力测试并最终投产。Presence 的平台化能力允许企业将已验证的策略、评估标准和升级规则复用到未来新的工作流和渠道,避免重新从零开发。

组件系统详解

Presence 由多个功能模块组成,协同实现代理生产级运行:

  • 策略与标准操作流程(Policies & SOPs):定义代理必须遵守的行为准则,不同业务场景可设置不同策略。
  • 护栏(Guardrails):实时监控交互,当会话超出预设安全或合规边界时主动干预。
  • 已批准的行动(Approved Actions):限制代理只能在预授权的能力集内使用工具或修改数据。
  • 模拟器(Simulations):在部署前用常见请求、边界案例和高风险情景测试代理表现,无需将客户暴露风险。
  • 评估工具(Evaluation Tools):包括自动评分器,检查代理是否达到正确结果、是否遵循策略、是否正确使用工具、是否在合适时机升级。
  • Codex 驱动的改进循环(Codex-powered improvement process):结合 Presence 插件,对生产会话、升级信号和质量反馈进行分析,发现待优化点并生成可复现的更改建议,团队可在对照基线测试后批准并逐步推出。

实际部署信号与数据

OpenAI 自身已在官方英语电话支持热线 1-888-GPT-0090 上线 Presence 代理。该代理负责处理开放性客户请求,核实身份、读取账户上下文并执行授权操作。在数周内即达到甚至超过衡量一线人工客服质量的基准指标,目前可独立解决 75% 的呼入请求,完全无需人工介入。在 OpenAI 发布团队的协助下,通过 Codex 驱动的改进循环,仅用 10 天就将人工转接率又降低了 15 个百分点

外部企业案例进一步表明产品可靠性:

  • 西班牙对外银行 BBVA 在墨西哥探索使用 Presence 为日常银行需求提供 AI 语音支持。
  • SoftBank 正在测试面向日本客户的日语自然对话服务。
  • 国际航空集团 IAG 正在测试在极端天气等高需求事件期间为旅客提供及时支援。

关键概念与机制

工作流固化与权限边界

不同于通用型 AI 助手,Presence 强调“一代理一工作(one job per agent)”,从根本上限制了权限范围和知识暴露面,减少幻觉和越权风险。结合企业自定义的权限矩阵,代理的行为被严格限定在可审计的框架内。

全生命周期信任模型

  • 部署前:通过模拟和评分器进行大量“静态+动态”测试,确保代理对政策、工具使用和升级规则的掌握程度。
  • 部署中:护栏机制实时防御脱轨行为;所有行动均为预先批准范围内的操作。
  • 部署后:利用生产数据持续监控代理质量,Codex 引擎自动检测需要适应的政策变化或新出现的客户需求模式,生成可人工审核的补丁方案,再通过分阶段发布进行上线。平台还设计为能够跟随企业业务和客户演变而“共学共进”,同时保持决策控制权在企业手中。

与前沿研究的飞轮效应

Presence 的产品开发与 OpenAI 研究团队深度绑定,每次客户部署产生的经验教训都会反哺基础模型和工具链研究,进而提升未来所有客户可用的模型能力。

非自助式的部署模式

目前 Presence 以“产品+服务”的方式交付:每个部署由 OpenAI 前沿部署工程师和经筛选的全球系统集成商专门领导实施。这保证了早期部署的品质和安全性,但也意味着其不是即插即用的 SaaS 软件。

优势、局限与适用场景

优势

维度说明
可靠性经过 OpenAI 自身海量电话业务验证,可独立解决 75% 问题,且能通过迭代持续降低转人工率。
信任框架完整性覆盖部署前、中、后的全周期治理,集成策略、护栏、模拟与评估,非仅靠 prompt 约束。
持续适应能力Codex 驱动的改进回路由数据发现知识缺口并生成建议,使代理能跟随业务变化在线演化。
复用性已验证的策略和评估标准可跨工作流和渠道复用,降低边际扩展成本。
人类深度参与始终保留人工升级和审批环节,并不追求完全自主,适合高风险、高合规要求的行业。

局限与潜在风险

局限/风险分析
交付门槛高需 OpenAI FDE 或指定集成商参与,投入时间和资源较大,不适合轻量级或快速自助试验。
语言与区域覆盖有限公开案例集中在英语、日语、西班牙语等语种的早期探索,大规模的多语言、多法规合规能力尚需验证。
对 OpenAI 生态的依赖Presence 深度绑定 Codex 改进引擎和 OpenAI 模型能力,客户数据和技术栈可能存在供应商锁定风险。
公开验证数据有限除 OpenAI 自身电话热线的数据外,外部企业案例仍处于“探索”或“测试”阶段,缺乏大规模、跨行业的长期稳定性公开报告。
透明度不足护栏、模拟和评估器的具体技术实现未披露,外部难以独立审计其安全性和公平性。

适用场景预判

  • 高通话量、高一致性的客服场景(如银行、保险、航司、电信)。
  • 需严格遵循合规流程的内部 IT 或 HR 支持工单。
  • 企业已有明确 SOP,且愿意投入前期共同设计代理边界的组织。
  • 不适合创意式、开放式咨询,或对即时上线要求极高且无法接受集成商参与的小型团队。

关键要点总结

  1. Presence 不是单一的对话模型,而是包含策略、护栏、评估与持续改进回路的完整企业代理生产系统。
  2. 产品注重“先验证、后交付”,通过模拟和评分器实现部署前质量保证,通过 Codex 改进回路实现持续演进。
  3. OpenAI 用自身电话支持业务验证了产品能力(75% 无人介入解决率,10 天降低 15% 转人工率),具有较强说服力。
  4. 产品的设计哲学强调“权限最小化”和“人类兜底”,适用于高价值、高风险任务,而非追求全自动。
  5. 当前交付模式为高接触服务,依赖 OpenAI 工程师和系统集成商,限制了其快速规模化推广的速度,但保障了早期成功。
  6. BBVA、SoftBank、IAG 等早期客户显示产品在金融、通信和运输领域的跨行业潜力,但尚需更多公开证据佐证其稳定性和投资回报率。

参考资料