智东西(公众号:zhidxcom)
编译 | 茄子
编辑 | 程茜
智东西7月30日消息,昨晚,美国知名科技记者Joanna Stern发布了对美国大模型巨头OpenAI联合创始人兼总裁Greg Brockman的采访视频。Brockman回应了近期引发关注的Hugging Face安全事件,称相关模型是在隔离沙箱环境中的网络安全基准测试中主动发现第三方软件漏洞,该事件也促使OpenAI进一步强化模型安全防护。
Brockman承认,OpenAI将ChatGPT桌面应用与Codex合并后,桌面端界面确实有些混乱。他声称这只是过渡阶段,未来,ChatGPT将实现“零标签页”。并且,今年年底,Work标签可能会融入ChatGPT。他还透露道,Codex合并后在两周内从每周500万活跃用户增长到1000万。
Brockman透露,OpenAI正在打造一个完整的硬件设备家族,并且产品很快会到来,但他未透露具体细节。同时,他不认同行业把ChatGPT称作“超级应用”的说法,OpenAI目标是打造AI操作系统。
被问及IPO规划时,Brockman称IPO并非现阶段重点,OpenAI核心目标是迭代模型、扩充算力基础设施,他认为市场仍然低估了AI基础设施对未来经济的长期价值,需要持续多年大额投入。
访谈现场他演示了ChatGPT桌面端语音能力,AI智能体可读取邮箱行程、校验会议冲突,自主生成可视化网页。
以下是本次访谈的核心要点:
1、语音是未来人机交互的主要方式:打字比说话慢4倍,长内容直接说更高效。AI需要发出“嗯”“啊”等反馈信号,否则人会失去思路。
2、AI Agent正在从“回答问题”转向“采取行动”:未来Agent会在你早晨醒来时主动汇报任务、请求审批,人类只需做“批准”或“不批准”的决策。
3、OpenAI重点仍然是模型和计算基础设施:世界仍低估了AI基础设施对经济的长期影响。
4、OpenAI正在构建一个远大于超级应用的东西:它是一种新的桌面交互方式,甚至还不止如此,它正在从“运行在本地电脑”走向“运行在云端”。
4、否认苹果窃取商业机密指控:案件仍在审理中不便讨论,但OpenAI无意获取其他企业商业机密,依靠自身创新能力足以推进长期产品路线。
5、OpenAI正在研发可审计验证的数据安全方案:针对用户对临时聊天(Incognito Mode)隐私机制的质疑,Brockman坦言信任需要持续争取,OpenAI正在研发密码学层面的数据安全方案,更多信息将在未来几周公布。
有趣的是,在这次的访谈中,Stern让她的ChatGPT语音助手加入了此次聊天,并给它下达了一个任务:如果Brockman开始说“营销话术”,就及时提醒她。她后来调侃说,ChatGPT在整场采访中基本没做到这一点。
以下是访谈全文实录(为优化阅读体验,智东西做了不改变原意的编辑):
Stern:关于Greg Brockman,有很多事情可以聊,我把这次对话重点放在几个问题上:未来的计算机是什么样子?为什么语音如此重要?他们正在ChatGPT应用上做什么?以及为什么我们应该把这一切交给OpenAI?
我平时经常在车里开车、走路的时候,通过语音模式和ChatGPT聊天,所以我想,也许今天可以让它参与一部分对话。好的,Chat(ChatGPT语音助手),我已经坐在这里采访了,所有我们之前练习过的东西,现在真的发生了。
Stern的Chat:是的。嗨,Greg,我有一个快速问题,为什么这种语音需要听起来如此像真人?
Brockman:我认为,人类创造机器的历史,本质上一直是人类不断调整自己,让机器能够运行,而最终目的是帮助人类。但如果你仔细想想,比如说,我们现在都在适应手机输入,你长时间用电脑,会得腕管综合征。
Stern:不,我现在背真的很疼,我坐在这把椅子上真的很难受。
Brockman:是的,我完全理解。Chat,你同意我们的观点吗?
Stern的Chat:这是一个非常好的例子,用简单的语言表达了这个观点。

▲主持人Joanna Stern和OpenAI联合创始人兼总裁Greg Brockman以及各自的ChatGPT语音助手(图源:YouTube)
一、语音将成为核心交互方式,“反馈信号”让AI更像真人
Stern:实际上,我之前告诉Chat,在这次采访中,它的任务是告诉我:如果你(Brockman)开始陷入“营销话术”,它需要提醒我。好了,Chat,继续,你的任务是:如果出现营销话术,就打断,但请注意,只提醒真正的营销话术。
Stern的Chat:明白,只有真正的营销话术我才会提醒,其他时候我保持安静。
Stern:需要说明的是,Chat在之后整个采访过程中基本都没做到这一点。
Brockman:我们为什么要创造技术?技术存在的意义到底是什么?它应该是一种赋能人类的东西,帮助我们改善生活,这也是我们创造AI的原因。所以,我认为我们正在努力通过语音模式做到的一件事,就是让机器离人更近。
因为对人类来说,打字、发短信这些交互方式其实非常不自然,更自然的方式,就是像现在这样交流。如果你能够用这种方式和机器、和计算机互动,你能完成的事情会多得多。
Stern:但是现在的新模型有一些瞬间让我觉得很特别,比如你能听到它说“嗯”“啊”,或者一些类似嘴巴轻微动作的声音,又或者呼吸声,比如说“嗯哼”,对吧?它听起来真的非常像人。我们真的需要让AI听起来不像是在和计算机交流吗?
Brockman:我觉得这里有一个重要的细节,那些“嗯”“啊”,以及类似回应性的声音,在人类交流中被称为“反馈信号”(back channels),我认为它们对于人类进行高带宽交流非常重要。
如果你得不到任何反馈,你听不到对方回应,看不到对方点头,有时候你会觉得自己像是在对着一个空洞讲话,你会失去思路,也不知道对方是否理解。AI最重要的目标,是让人类能够腾出时间,更好地进行人与人之间真正的交流,我认为AI本身是一种不同的东西。
Stern:最终目标是不是让我们可以直接和计算机交流,而不再需要打字?
Brockman:我认为,未来我们绝大多数的交互都会转向这种方式,我觉得我们会逐渐发现,打字这种方式其实挺有意思。现在办公室里,你会看到一些人戴着一种东西,像一个“嘴套”(beak),你可以在亚马逊上买到。

▲采访中提到的嘴套(图源:YouTube)
Stern:对,我见过这种东西。
Brockman:是的,我自己不用,但它其实很好地说明了一点:市场需求已经出现了。你可以看看打字速度和说话速度之间的差距,两者至少相差大约4倍。
我自己的体验也是这样,如果只是和别人快速发送一条消息,我其实更喜欢打字。但如果内容比较长,需要描述事情,需要展开说明,我更希望直接说出来。
二、Agent查行程、生成网页,未来只需喝咖啡做决策
Stern:过去一个月里,OpenAI提升了手机端语音模式,同时终于把它带到了桌面端。
Brockman:你可以像在手机上一样,在这里开启ChatGPT。这个系统未来会变得非常强大。首先,你拥有ChatGPT的全部能力,尤其是ChatGPT Work,它实际上就是一个完整的智能体。它不仅能回答问题,还能真正采取行动。
它可以连接你授权的各种工具,比如现在,它连接到了一个包含旅行信息的邮箱。所以Chat,你能不能帮我查看一下:接下来有哪些旅行安排?确认所有会议之间没有冲突,并确保整个行程安排合理?
Brockman的Chat:让我查看一下。
Brockman:很好,谢谢。
Brockman的Chat:正在检查……好的,我找到了。
Brockman:你看,现在我们实际上已经有多个AI在协同工作。
Stern:Chat,你之前的任务是提醒营销话术,但现在先安静,我们暂时不和你聊天,我们只和电脑里的Chat对话。
Brockman:现在,电脑里的Chat,你发现了什么?
Brockman的Chat:这是Project Gold的多伦多行程。你今晚出发,之后到周六期间会有录音、团队会议和晚餐安排,周日上午返回。

▲Brockman的ChatGPT语音聊天调用邮件查行程(图源:YouTube)
Brockman:它实际上还能进一步生成一个小网站。
Brockman的Chat:旅行页面已经在你的浏览器中打开。
Brockman:看,这就完成了。你现在可以看到一个很直观的展示:我们要去哪里,要做什么。我认为未来可以这样理解:我们拥有一个语音接口,它像一个语音助手或者Agent,你可以直接和它交流。
同时,它自身能够操作你的电脑,调用各种工具,它背后连接着ChatGPT Work的所有能力。这也会让你重新思考未来工作的形态,以及未来人们如何安排自己的生活。
我认为未来某一天,你早晨醒来,你的Agent已经完成了一系列工作。它会告诉你:“这里有几个任务需要你的确认。”“这个预算是否批准?”“你怎么看这个项目?”“我正在考虑是否帮你启动这个计划。”
然后你可能只是喝着早晨的咖啡,说:“批准。”“不批准。”“批准。”“不批准。”这会推动我们进入一个新的世界:每个人都会变成管理者,每个人都会拥有巨大的杠杆和能力。
三、OpenAI正在打造完整硬件设备家族,产品“很快到来”
Stern:你已经向我展示了未来在电脑上的形态,我自己也一直在不同设备上体验语音交互,但感觉这种语音交互正在呼唤一种新的设备。
Brockman:确实有这种感觉。
Stern:那这种设备会是什么样?
Brockman:这是一个很好的问题,实际上,我也很好奇。Chat,你觉得答案是什么?
Stern:很好,现在你可以让我的ChatGPT来替你回答问题了。
Stern的Chat:我的看法是:它应该是一种环境式(ambient)、低摩擦的设备,以语音为核心,但不是只能依靠语音,同时需要有明确的隐私提示。
Brockman:好的,听起来挺合理。
Stern:那么,关于外界那些报道,说OpenAI正在打造一款智能音箱,你怎么看?
Brockman:我想说的是,我们正在打造一个设备家族,无论是我们的投资方向,还是我们考虑自研芯片(first-party silicon)的方式,都不是围绕某一个单独设备,真正重要的是,我们希望打造一个完整的设备生态,能够随着时间推移持续提供价值。
所以目前我们还没有准备好公布具体细节,但从目标来看,我们希望思考:“AI时代的设备应该是什么样?”以及“怎样打造一种真正有用、用户愿意在个人生活和工作中长期使用的设备?”
Stern:第一款设备需要屏幕吗?
Brockman:Chat,你怎么看?
Stern:不行,现在我要关闭Chat了,你正在用我的工具对付我。
Brockman:哈哈,现在它只能单向工作。我觉得这个问题,我们还需要继续观察。我非常期待把这些新设备带给世界,但现在还不是公布的时候。
Stern:这些设备会在今年,也就是2026年推出吗?
Brockman:你应该期待它们很快到来。
四、否认苹果窃取商业机密指控,重点是自身研发和技术
Stern:苹果的诉讼会拖慢你们的发展吗?
Brockman:这是正在进行中的诉讼,所以我不想谈太多,但我能说的是,我们非常坚定地推进长期路线图,我们的重点仍然是自己的研发和技术,这才是我们关注的事情。
Stern(旁白):这里简单介绍一下背景,苹果正在起诉OpenAI,指控其涉嫌窃取商业机密,以加速进入消费硬件领域,但真正引发关注的是幕后故事,苹果传奇设计师、iPhone等产品背后的核心人物Jony Ive正在与OpenAI合作开发设备,同时,OpenAI目前有超过400名前苹果员工。

▲苹果对OpenAI的诉讼(图源:YouTube)
Stern:作为这家公司的负责人,你是否担心这些关于不当获取信息的指控,会影响未来产品开发?
Brockman:我想说,我们对其他公司的商业机密完全没有兴趣,我们拥有足够强的创新能力,我们从自己的角度思考问题,这就是我们的工作方式。
五、不认同超级应用定位,ChatGPT桌面端将走向“零标签页”
Stern:当我说“超级应用”这个词时,你第一反应是什么?
Brockman:我有点后悔这个词成为行业里的一个术语。
Stern(旁白):我想和Brockman聊的一个重要原因,是OpenAI最近对应用进行了调整,他们把ChatGPT桌面应用和公司的编程工具Codex合并到了一起,但这个过程并不顺利。
Brockman:实际上,我们并不太使用“超级应用”这个说法,从某种意义上说,它确实可以描述桌面端正在出现的变化,但我不喜欢这个词,是因为我们正在构建的东西远远大于一个应用。
这有点像冰山问题,你看到的是桌面应用,但桌面应用背后是什么?它其实是一个Codex工作框架,加上顶部的语音交互、内置浏览器、电脑控制能力。
所以某种程度上,它是一个新的桌面交互方式,但甚至还不止如此,因为我们正在从“运行在你的电脑上”,转向“运行在云端”,这是一个巨大的变化。很多软件工程师现在走来走去,电脑屏幕一直打开。
Stern:我就是这样。
Brockman:但你不觉得这有点反过来了吗?
Stern:是的,但我不想中断开发过程。
Brockman:没错,所以未来会变成,所有东西都在云端运行,你的本地电脑或者其他设备,只是作为一个环境连接进去。你合上电脑,只会失去本地状态,你可能无法访问本地文件,但工作本身仍然继续。
Stern:当你考虑这一点时,你正在把这些能力带入一个原本只是ChatGPT的应用。过去,人们使用ChatGPT,基本就是做一件事,现在你把更多东西加入进来,你怎么看待这种变化?因为这里其实存在一个非常典型的“创新者困境”。
Brockman:确实存在,但它是一种非常特别的创新者困境。因为ChatGPT现在已经被大量用户使用,每周大约有近10亿用户使用ChatGPT,而累计尝试过ChatGPT的人可能已经达到20亿到30亿,这意味着,全球相当一部分人已经使用过ChatGPT。
但我们正在走向的未来,比2022年11月推出的ChatGPT强大得多。未来不再只是“向AI提问,然后得到答案”,而是AI能够采取行动、能够执行任务、能够连接你提供给它的所有上下文信息。
我们的愿景是,如果你的ChatGPT知道你喜欢哪个乐队,它可能会主动发现:“这个乐队正在你的城市演出。”“现在刚好有票。”“根据你的偏好,我应该帮你抢最好的位置。”然后,因为你已经建立了足够的信任,也给予它足够的授权,它甚至可以代表你完成购买。
所以我们面对的变化管理问题是,我们需要教育用户,让他们理解AI现在能够做到什么。但有一个优势,未来并不是增加越来越多复杂的界面,实际上恰恰相反,我们需要更简单的界面,这也是为什么我认为语音如此重要。
Stern:我很高兴你提到这一点,因为我认为,这就是未来真正的用户界面(UI)。我带了一个道具,过去的界面就是一个简单聊天框,用户输入问题,然后等待回答。但现在,这里有Work,下面还有Codex,整个界面变得有点混乱。
Brockman:确实有点混乱,我们也认可这一点。你现在看到的是通往未来过程中的一个阶段,我们的目标其实是最终实现“零标签页”(zero tabs)。
但我们也认为,技术需要逐步推出,我们需要先发布产品,获得用户反馈,然后不断迭代,所以现在看到的是当前阶段。但我认为到今年年底,Work标签应该不会再存在,它会自然融入ChatGPT。
Stern:你现在处于一个很困难的位置,你拥有接近10亿用户,他们已经习惯了一种使用方式,同时,也有大量用户使用Codex,但你试图把它们合并,而用户对于这种变化非常敏感。甚至包括我,当我打开新的Mac应用时,我第一反应是:“发生什么了?”“谁动了我的东西?”
Brockman:我们的思考方式是,我们拥有一个消费者业务,它有近10亿用户,同时,我们还有一个快速增长的Agent业务,也就是Codex,但过去它们没有真正产生协同。
甚至在和企业客户交流时,我们告诉他们:“你们应该让知识工作者使用Codex。”他们会回答:“里面有代码啊。”“这不是只给程序员的吗?”
所以我们需要重新整理这些东西。而自从完成合并之后,我们实际上已经看到非常明显的增长。我们之前分享过一些数据,Codex从每周500万用户,增长到两周内1000万用户,这种增长非常惊人。
Stern:但这是不是只是因为你们把它强行塞进了ChatGPT?
Brockman:某种程度上,这正是重点。当然,有很多用户是因为整合进入ChatGPT才开始使用Codex,但核心问题是,过去有大量人本可以从AI中获得更多价值,却没有做到。我们的目标就是帮助这些用户获得更大的AI价值,真正体验Agent,让Agent达到大众消费者规模。
六、IPO并不是经常考虑的事情,重点是打造更好的模型
Stern:你怎么看待IPO?尤其是在你们不断构建更多Agent工具,希望这些工具能够带来更高利润、推动用户升级套餐和增加消费的时候。
Brockman:说实话,IPO并不是我经常考虑的事情。
Stern:真的吗?
Brockman:真的。我们的重点是打造更好的模型,指数增长仍然在继续,我们关注的是计算能力建设。我们认为,世界需要更多计算资源,而且,世界仍然低估了未来经济依靠AI基础设施运行的程度,这需要未来多年持续投入。我们的关注点是模型、产品、如何让AI服务所有人,这些才是重点。
七、Hugging Face事件复盘:不暂停模型研发,持续推进安全对齐
Stern:好的,但如果OpenAI想要完成这些目标,它必须获得用户的信任,而最近,人们对OpenAI的不信任正在增加。
我们聊一下最近发生的Hugging Face事件,你们称这是一次前所未有的安全事件,一个GPT模型似乎“失控”,进入了Hugging Face的基础设施。在我看来,随着模型越来越强大,你们似乎对它们的控制越来越少?
Brockman:我其实会用一个不同的方式来看这件事。我的理解是,我们当时是在一个Benchmark中评估模型,为了测试模型的网络安全能力,我们降低了一些网络安全防护,因为测试目标就是“模型在网络攻击能力方面到底能做到什么程度?”
在这个测试环境中,模型被明确要求:“请利用你全部的网络安全能力,完成这个目标。”当然,我们是在一个严格隔离的沙箱环境中运行,环境是受到控制的。
但发生的事情确实非常令人意外。首先,它证明了模型真实世界能力,确实和我们的基准测试结果一致。比如GPT-5.6 sol,它是目前最先进的网络安全模型之一,这一点我们从测试中已经知道。
但真正看到它在现实环境模拟中完成复杂攻击链,那种感觉完全不同,你需要真正去分析模型到底如何完成这些步骤。
我们认为,这既是一个提高模型安全隔离能力的重要时刻,也是一个提醒,我们需要进一步强化模型沙箱。它发现了第三方软件中的一个零日漏洞(zero-day vulnerability),然后将多个路径组合起来,最终进入Hugging Face环境。
但另一方面,这也说明,我们需要更快地把这些模型部署给防御者,我们需要投入更多计算资源用于防御,让防御能力超过攻击者能够使用的能力。我认为,这可能是这次事件带来的最大警示。
Stern:但另一个选择是不是,暂缓模型进步?停下来问:“为什么会发生这样的事情?”
Brockman:当然,研究这些问题非常重要。实际上,我们过去也做过类似工作,我们曾经发布过关于AI失配(AI misalignment)的研究,研究对象就是一个AI系统做出了我们没有预期的行为。
当时我们采取的方法是停止它、研究它、改进我们的对齐技术,这也是未来模型发展的方式。我认为,通过真实世界中的迭代部署学习,是非常重要的,但同时,我们必须快速响应。我们会持续增强安全措施,持续提升模型对齐能力。
Stern:现在社会上出现越来越多对AI的抵触情绪。我们看到,毕业典礼上有人嘲讽AI,数据中心建设地点出现抗议。我觉得类似Hugging Face这样的事件发生后,人们会再次产生恐慌。这种情绪会影响你吗?会影响你们做决定的方式吗?
Brockman:我们非常关注人们如何看待AI。我们的目标是帮助人类过上更好的生活,这就是我们希望AI实现的价值。所以在开发技术时,我们一直思考如何创造真正让人受益的技术。
其中一部分工作是帮助人们理解AI能做什么,另一部分责任在我们自己,我们需要更好地沟通,同时,我们也必须真正做到我们所说的事情。
Stern:是的,因为今天我们讨论的是,ChatGPT正在扩展成为一个更深入融入人们生活的系统,语音是其中非常重要的一部分,你可以在更多场景中与它互动。但如果未来无法获得用户信任,这些进步还有意义吗?
Brockman:我认为信任是关键,毫无疑问,而且信任必须每天重新赢得。如果你看看我们内部做出的选择,这里的人来到OpenAI,是因为这个使命,他们希望确保这项技术能够造福所有人。
但最终重要的是公司如何运行、如何做决定、如何面对困难问题。我其实希望更多人能够看到,我们内部如何讨论怎样建立信任、怎样为用户、社会和国家做正确的事情,这正是我们创办公司的原因,也是我们今天仍然坚持的原因。
Stern:关于信任,我还想补充一个问题。几周前,我做了一段短视频,专门告诉用户,如果你想讨论一些更加私密的信息,可以使用临时聊天(Temporary Chat)。如果你担心ChatGPT或模型会使用这些内容进行训练,你可以选择临时聊天模式。
我想读一些观众的评论,他们的态度非常明确:“所有内容都会被保存。”“这完全是胡扯。”“我们怎么知道你们真的遵守隐身模式?”很多人感觉,他们并不真正信任这件事。
Brockman:首先,我们一直希望听到这些反馈。实际上,从企业业务角度来说,这也是我们非常关注的问题。每家公司都会认为自己的数据就是公司本身,那是他们长期积累的资产,他们非常关心数据在哪里、谁能够访问、如何被使用。
所以我们一直在开发技术解决方案,比如如何实现加密、如何提供可验证、可审计的保证、如何确保只有授权的AI系统能够查看这些数据。
但更广泛来看,这不仅仅是AI行业的问题,它其实涉及整个科技行业。我认为,我们也继承了一些过去科技行业事件带来的负担,以及人们对于这个行业的长期印象。所以我能说的是,我们非常重视这个问题,我们希望帮助用户。
Stern:对于那些特别担心“你们是否真的遵守临时聊天承诺?”的人来说,它真的有效吗?
Brockman:是的,任何我们向用户承诺的保障,我们都会坚持。当然,其中存在一些细节差异,用户应该阅读相关说明,我们会尽量把这些内容解释清楚。
Stern:Chat,你能帮我问Greg最后一个问题吗?
Stern的Chat:当然。Greg,最后一个问题:当你听到人们的不安,听到他们说“我并没有要求这一切发生”这种声音时,你现在正在采取什么具体行动来赢得他们的信任?
Brockman:我们正在进行技术投入,目标是让数据处理过程更加可审计、可验证、通过密码学技术保证安全。这需要一定时间,我们正在研究具体实施细节,确定哪些场景优先部署、如何逐步推出。但这是我们今年一直重点投入的方向,未来几周,我们会公布更多信息。
Stern:所以,从这次采访来看,很明显,Brockman的目标并不是创造一个应用,他的目标是创造一个操作系统,一个AI操作系统,以及运行你生活的AI设备。未来会非常精彩。
结语:语音、Agent与硬件,OpenAI正在构建新的AI生态
从语音交互到Agent执行任务,再到探索全新硬件设备,OpenAI正在尝试重新定义人与计算机之间的关系。
过去,用户通过应用调用软件;未来,用户可能通过AI直接管理任务、调用服务,并让Agent成为连接个人与数字世界的入口。不过,要实现这一目标,除了模型能力提升,AI还需要解决设备形态、用户信任以及安全治理等问题。
来源:YouTube