截至 2026 年 9 月 1 日,我检索到关于 Tibo(Thibault Sottiaux)最新的一场公开 YouTube 长访谈,是 Matthew Berman 在 8 月 24 日发布的 How to Understand the Next Wave of AI Before Everyone Else。44 分钟里,这位从 Codex 走向 OpenAI 核心产品负责人的工程产品领导者,谈了 DeepMind 的教训、Codex 与 ChatGPT 的合并、个人智能体、云端执行、Ultra Fast、算力效率、递归式自我改进和安全暂停。
如果只看热闹,最容易记住的是 Tibo 那个可以重置 Codex 用量的实体按钮;如果看产品路线,真正重要的却是另一件事:Codex 正在从“替程序员写代码的工具”,变成 OpenAI 用来探索下一代通用智能体的产品原型。
这篇文章按完整逐字稿重新整理访谈的十个关键判断,并在后半部分用一种接近马斯克的第一性原理方法,把“个人 AGI”“云端 Agent”“超高速推理”这些宏大叙事拆回基本变量。涉及路线、数字和安全判断的内容,我会区分 Tibo 的原话、主持人的提问与我的推演,避免把产品愿景直接写成已实现的事实。
观看原始访谈(44:28) · 封面使用原视频缩略图,版权归 Matthew Berman / YouTube 原权利人所有。
1. 真正拉开差距的,不只是研究能力,而是把能力交到用户手里的组织能力
Tibo 从自己在 Google DeepMind 的经历谈起。ChatGPT 发布大约一年前,团队内部已经有类似 LM Chat 的对话产品探索,模型也从“有趣”逐渐变得“有用”。问题不在于没有技术和想法,而在于 DeepMind 当时并不是一个以交付产品为核心搭建的组织。
他把 OpenAI 的差异总结成三个部分:研究与产品紧密协作;组织自下而上,个人可以迅速聚集资源验证想法;面对新产品时,内部很少出现过强的 stop energy。但他也补上了另一半:快速交付不能变成功能拼盘,仍要用简洁、性能、效率和整体产品质量约束方向。对应视频 0:45–4:22
对创业者,他给出的建议是有判断、尽快接触真实用户、根据反馈迭代,并愿意主动颠覆自己的主业务。即使已经拥有一台“印钞机”,也必须在能力拐点出现时重新分配资源,因为技术演进不会等待现有业务做好准备。对应视频 4:22–7:23
我认同这种交付文化,但不把“阻力少”简单等同于“决策好”。没有验证门槛的快,会制造债务;没有交付倾向的稳,会错过窗口。更完整的机制应该是:让实验低成本、让上线可回滚、让结果可测量、让高风险动作有明确审批。 这样组织减少的是无效阻力,而不是必要约束。
2. Benchmark 只能描述能力,真实使用才会发现产品
Tibo 提到一个很容易被忽视的事实:即使是 OpenAI,也常常要在模型训练完成后亲自反复使用,才会发现它真正适合做什么。Benchmark 无法穷尽产品形态。
他用语音举例。高质量语音与工具调用结合后,交互不再只是“把键盘换成嘴巴”,而是让人可以在早晨直接说出当天要做的事情,再由系统访问工具继续执行。能力变化打开了新的输入方式,输入方式又重写了人们对产品的理解。对应视频 5:47–7:23
这意味着模型评测和产品评测不能混为一谈:
- 模型评测回答“在受控任务上能不能做”;
- 产品评测回答“在真实上下文中能不能稳定完成”;
- 行为数据回答“用户是否愿意把它放进日常工作”;
- 业务结果回答“完成之后是否真的创造价值”。
AI 产品最危险的误区,是拿第一层的提升替代后面三层的证据。
3. 下一代 Agent 的目标,是让 Harness 从用户视野里消失
Tibo 认为,今天的高级 Codex 用户已经习惯了很多不自然的操作:维护 Skill 文件、修补记忆、管理多个子智能体、理解它们怎样组成一个小网络。这些机制有用,却会不断打破“我在和一个真正理解我的搭档合作”的感觉。
他期待的系统应当理解个人目标、日常习惯和团队状态,不只等待命令,还能在适当时机主动行动。用户不应持续维护 Agent 的内部脚手架;记忆、Skill、子智能体和工具编排最终都应该退到产品内部。对应视频 7:23–9:38
这里的重点不是把配置入口全部删除,而是重新定义谁为复杂性负责。今天是用户在替 Agent 维护上下文,未来应该是系统主动整理、验证、淘汰和更新上下文,同时让用户看得见关键依据、能纠正错误、能控制边界。
最好的 Harness 不是没有结构,而是把结构变成可靠的系统能力,而不是用户的日常负担。
4. 模型能力继续上升后,笔记本电脑会成为“按人类设计的瓶颈”
Tibo 的一个强判断是:下一代模型需要的不只是用户的笔记本电脑。个人电脑的资源与界面,本来就是按人的输入速度、思考速度和有限多任务能力设计的;模型却可能同时操作远多于人类能照看的应用和任务。因此,更强的 Agent 会自然走向云端资源、并发执行和更大的工作空间。
当生成速度提升后,瓶颈会依次移到网络、工具调用、编译、测试和整个 Agent 轨迹的固定开销。解决办法也不只是继续加快 Token,而是把探索、写测试、编译和验证假设并发起来,让系统在同一时间推进多个相互独立的工作流。对应视频 9:38–10:44
但“更多云资源”并不自动等于“更好的 Agent”。云端还带来新的约束:数据权限、执行隔离、网络延迟、成本上限、状态一致性,以及用户如何知道后台究竟发生了什么。计算边界消失后,治理边界反而必须更清晰。
5. 速度的真正价值不是少等几秒,而是保护人的注意力
主持人描述了今天常见的重度工作流:一次启动十到十五个 Agent,三四十分钟后轮流接收结果,再不断切换上下文。Tibo 认为,产品应围绕人的注意力规律设计,而不是把并发数量本身当成先进程度。
当超高速模型与语音结合,系统可能和人一样快,甚至更快。用户可以保持在同一个问题里,边表达、边看原型、边调整方向,不必靠大量并行任务填满等待时间。对不喜欢频繁切换的人,速度带来的核心收益是保住 Flow;对擅长多线程的人,收益则可能没有想象中那么大。对应视频 10:44–12:23
访谈后面进一步澄清:如果任务主要是连续生成代码,例如快速做网站或游戏原型,体感可能接近十倍;如果流程包含大量工具调用,网络和轨迹开销会把端到端提升压到三到四倍。主持人提到的十四倍是模式标称量级,不应直接等同于所有真实任务的完成速度。对应视频 34:13–37:56
还需要注意产品命名:Ultra Fast 是这场访谈里的称呼;OpenAI 当前官方文档分别把 fast 描述为速度模式,把 ultra 描述为通过子智能体并行提高复杂任务能力的设置,不能只按字面把两者当成同一个公开选项。OpenAI Model Guidance
这也是一个很实用的产品判断:不要只优化模型延迟,要优化“从产生意图到看见可验证结果”的完整回路。
6. “个人搭档”和“后台自动化”是两类不同的 Agent 产品
谈到 Loop、Graph 等 Agent 技术时,Tibo 没有继续比较编排名词,而是把问题拆成两类。
第一类是个人智能体。它与人保持在同一个工作流里,理解这个人的长期目标与偏好,能够主动提出重要想法,也能处理编程、研究、建议等不同任务。这里最重要的是个性化、连续性和协作感。
第二类是端到端自动化系统。它在后台接管复杂流程,例如读取生产日志后自动优化性能、发现回归后修复,或者在安全扫描器发现漏洞后立即打补丁,把暴露窗口缩短到接近于零。人不需要持续控制,只在高风险动作上审批。对应视频 12:23–14:27
这一区分非常关键。个人搭档追求低摩擦沟通,后台自动化追求确定性、审计和异常恢复;前者要理解人,后者要约束系统。把两者塞进同一种聊天体验,会同时损害亲密感与可靠性。
7. ChatGPT 与 Codex 合并,目标不是少一个入口,而是同一个智能内核适配不同的人
对于 ChatGPT 与 Codex 的合并,Tibo 的解释很直接:未来模型使用的是同一种底层技术、Harness 和多模态能力,编程与非编程不应被分割成两套完全不同的智能系统。
他把职业标签视为人类处理复杂现实的抽象。软件工程师、设计师、产品经理并不是互不相交的物种,每个人都位于不同能力与需求构成的连续光谱上。因此,最终界面应该根据个人自动适配,而不是先要求用户选择“我是程序员”或“我不是技术人员”。他用 personal AGI 描述这个终态:同一套系统连接每个人不同的工具、目标和生活,产生不同的使用方式。对应视频 14:27–17:00
交互也会从文本框扩展成更自然、更环境化的存在。白板上的内容、人的语气、视觉线索和语音对话都可能成为上下文。Tibo 观察到新版语音上线后,完全通过语音使用 ChatGPT 的人快速增长,并把它归因于一个朴素规律:人会选择阻力更小的路径。对应视频 17:00–20:25
我赞同“一个智能内核”,但对“一个界面”保留意见。统一底层不等于抹平专业界面。 写代码需要 Diff、测试和版本控制,财务需要口径、审批和审计,医疗需要证据与责任边界。真正的自适应界面不是永远只剩一个输入框,而是系统能根据任务风险和领域结构,及时长出正确的工具。
8. Codex 的增长、社区与 Reset:用户信任不是营销口号
主持人在访谈中提到 Codex 达到 2,000 万用户。Tibo 把增长部分归因于 Codex 能力进入 ChatGPT,让产品触达原本不会主动寻找编程 Agent 的产品、设计、销售、市场和沟通人员。面对与 Anthropic 的比较,他没有直接评价对手,而是强调三件事:最强能力、极高效率,以及让尽可能多人获得有用产品。对应视频 20:25–23:37
社区最熟悉的 Reset,则起源于更具体的原则:如果团队迭代时把产品弄坏了,或者体验明显低于承诺,就补偿用户额外用量。后来 Reset 也被用来庆祝增长、邀请用户尝试新能力,甚至有了实体按钮。Tibo 强调,这并不是和市场、财务共同设计的活动,而是他认为“应该补偿”时可以做出的决定。对应视频 23:37–26:41
这个做法的价值不只在免费 Token,而在建立一种可感知的服务修复:出了问题,团队承认影响并给出补偿。不过,善意按钮不能替代稳定的容量规划、透明的计费规则和可预期的服务水平。用户最终需要的不只是偶尔被照顾,而是可以据此安排工作的可靠系统。
9. 递归式自我改进已经发生,但首先发生在基础设施
Tibo 解释,OpenAI 提前多年规划算力,一大部分计算资源继续投入研究,同时也持续优化现有模型的推理效率。更强模型已经被用来重构 Serving Stack、优化 CUDA Kernel、改进产品和寻找新的交互方式。访谈中他提到,普通模式的速度在三个月里大约提升了 60%;Luna 的显著降价则主要来自效率提升,并把收益继续传给用户。对应视频 26:41–30:25
OpenAI 的官方发布也能交叉验证这条路线:GPT‑5.6 Luna 降价 80%,Terra 降价 20%;更强模型参与了推理栈与 Kernel 优化,使更高吞吐能够在接近相同的算力包络中运行。OpenAI:提升 GPT‑5.6 的性价比
Tibo 把这视为递归式自我改进的早期形式。它不是模型突然无监督地创造下一代模型,而是一个更工程化的闭环:模型帮助优化承载模型的基础设施,基础设施让模型更快、更便宜、更容易被使用,新增使用又为下一轮研究和产品改进提供资源。对应视频 30:25–32:00
这种表述比“智能爆炸”更可信,也更值得产品团队学习。真正可复制的飞轮往往不是一句宏大叙事,而是把每一轮能力提升重新投入评测、工具、数据、运行时和交付效率。
10. 安全暂停、Ultra Fast 与广泛可及,构成同一条路线的三种约束
主持人问到 OpenAI 暂停最前沿强化学习训练的决定。Tibo 的说法是:能力提高后,对齐与安全的重要性同步上升;暂停给团队时间理解并加固系统,安全团队通过讨论和探索形成了一组相对清晰的原则,再决定何时以更充分的控制继续训练。对应视频 32:00–34:13
这段内容应谨慎理解。Tibo 没有公开暂停的具体触发条件、评估指标或恢复门槛,因此我们只能把它视为负责人对内部过程的概括,不能据此证明所有风险已经被解决。真正有意义的安全不是“曾经暂停”,而是能力、风险、评测、部署权限与事故响应之间存在可重复的治理机制。
Ultra Fast 则体现了另一端的约束:时间。OpenAI 内部会把更快能力优先给事故响应等高风险、每秒都重要的场景,也会给需要在截止时间前快速验证的新产品探索。对于大量工具调用的任务,它不会获得完整的标称速度;对于共享画布、实时原型、语音协作等非文本交互,它却可能改变创造过程。对应视频 34:13–40:00
即使 OpenAI 员工理论上能消耗大量 Token,Tibo 说团队也没有把 Ultra Fast 无限制开放给所有内部员工,而是控制内部使用,把绝大部分容量留给外部客户。这个细节说明速度模式不只是模型问题,也是容量分配与产品承诺问题。
Tibo 预计类似速度在一两年内会接近默认水平,同时永远存在一个更昂贵、更高性能的上一档。访谈最后,他用 Luna 说明“今天的前沿能力会迅速变便宜”,并把效率提升与广泛可及联系起来;对尚未尝试 AI 的人,他建议先从写作、个人建议、健康和财务等具体帮助出发,而不是先接受一整套宏大未来叙事。对应视频 40:00–44:28
用第一性原理重算一次:Agent 产品到底在优化什么?
马斯克常用的第一性原理方法,不是从行业惯例继续加功能,而是把系统拆到无法再删的基本事实,再从底层重新推导。沿着这条方法,我会先把“更好的 Agent”写成一个更朴素的目标:
在可接受的总成本与风险下,用更少的人类注意力,稳定地产出可验证的结果。
这里没有模型名字,也没有 Chat、Codex、Skill、Subagent 或 Cloud 这些产品形态。它只包含七个基本变量:目标是否清楚、上下文是否充分、推理是否足够、工具能否行动、反馈能否验证、风险能否控制、人的注意力是否被正确使用。
从这个目标出发,可以推导出六个结论。
1. Token 速度不是终点,闭环速度才是
如果模型快十四倍,但工具调用、网络、权限确认和测试没有变快,任务就不会快十四倍。真正需要测量的是:从用户表达目标,到系统完成行动、通过验证、交回结果,端到端用了多久。
所以 Ultra Fast 的价值不应只写成 Tokens per Second,而应看三种时间:人等待了多久、系统完成了多久、错误被发现并修正用了多久。速度如果让验证跟不上,可能只是更快地产生返工。
2. 算力越丰富,调度与验证越稀缺
当 Agent 可以同时操作一百个应用,问题不再是“能否并发”,而是“哪一百件事值得做”“冲突怎样处理”“完成标准由谁定义”。并发能力扩张会把瓶颈推向任务分解、优先级、状态管理和验收。
这与软件工程史很像:计算资源便宜后,复杂性没有消失,而是上移到了系统设计。Agent 时代的稀缺资源会从生成能力转向可靠编排。
3. 个人智能体与自动化系统不能共用同一套控制逻辑
个人智能体需要连续理解、低摩擦表达和适度主动;后台自动化需要权限最小化、幂等、审计、回滚和升级路径。一个是协作关系,一个是生产系统。
因此,产品设计至少要先回答:这是一个人在环内的搭档,还是一个人只在异常和高风险动作上出现的自动系统?不回答这个问题,就无法正确设计记忆、通知、审批和失败恢复。
4. “同一个智能”不等于“同一个表面”
Codex 与 ChatGPT 共用模型、Harness、记忆和工具层是合理的,因为底层问题都在理解目标并执行动作。但任务不同,验证结构也不同。代码要看 Diff 和测试,研究要看来源,数据分析要看口径与可复现过程。
更合理的终态不是一个万能聊天框吞掉所有软件,而是同一个智能内核按任务动态生成专业界面,并保留领域所需的证据和控制。
5. 递归式自我改进的现实起点,是可测量的工程飞轮
模型优化 Kernel、Serving、测试和产品代码,比讨论无边界的自我进化更接近今天可以验证的事实。如果一轮优化让单位结果所需算力下降,更多用户开始使用,真实工作负载暴露新瓶颈,再由模型参与下一轮优化,这已经形成可复利的系统。
企业不必等待“模型训练模型”的终极版本。先让 Agent 帮助改进自己的评测、工具可靠性、上下文质量和交付流程,就能建立一个更小但真实的自我增强闭环。
6. 智能越便宜,责任越不能被隐藏
推理成本下降会让更多动作值得自动化,却不会自动降低错误的业务代价。Agent 可以在一分钟内生成系统,也可以在一分钟内扩大一个错误。越是走向个人信息、财务、健康、生产系统和安全响应,越需要明确证据、权限、最终责任人与停止条件。
广泛可及不只是“人人都能调用”,还应包括普通人能理解系统做了什么、为什么这样做、如何拒绝,以及出错后谁来处理。
我对 Codex 下一阶段的判断
这场访谈并没有公布一张可以照抄的产品路线图,却把方向说得很清楚:Codex 今天暴露出的 Skill、Memory、Subagent、并行任务和云端环境,不是最终产品,而是下一代智能体正在长出来的骨架。
我认为接下来真正值得关注的,不是 Codex 会不会多一个模式,而是四个变化:
- 从 Prompt 到 Goal:系统围绕长期目标组织工作,不再只等待单次指令;
- 从生成到执行:价值从回答问题转向跨工具完成并验证任务;
- 从本地窗口到云端工作空间:计算和并发突破个人电脑,但权限与状态必须可治理;
- 从统一入口到自适应工作台:底层智能收敛,界面却会根据任务长出不同的专业结构。
对做 Agent 产品的人,眼下最有价值的动作不是猜“personal AGI”哪天到来,而是找一个真实工作流,把目标、Context、工具、验收、权限和异常路径连成闭环。然后持续观察瓶颈移动到哪里:模型、工具、网络、算力、人的注意力,还是组织决策。
Tibo 这场访谈最重要的提醒也正在这里:技术迭代不是把同一个环节无限加速,而是不断改写整个系统里最稀缺的东西。今天我们管理 Skill 和 Subagent,明天这些细节可能都会消失;但定义正确目标、提供真实上下文、验证结果并承担责任,不会因为 Agent 更强而自动消失。
参考资料:
- 原始视频:How to Understand the Next Wave of AI Before Everyone Else | Tibo Interview
- 原节目页面、章节与英文逐字稿
- OpenAI Forum:Codex is for Everyone
- OpenAI:Advancing the price-performance frontier with GPT-5.6
- TechCrunch 对 Tibo 的后续访谈
本文封面为原 YouTube 视频封面,仅用于指向和评论该访谈;正文为基于完整访谈的中文整理、事实核对与原创分析。