智东西5月11日消息,今天凌晨,OpenAI宣布将于美国时间13日上午10点(北京时间14日凌晨1点)在官网直播,演示ChatGPT、GPT-4的更新内容。
据报道,OpenAI正在构建具备音频和视觉理解能力的AI语音助手,其中一些功能已经开始向客户展示,可能在下周的发布活动中预览。
知情人士消息透露,OpenAI可能会在今年内完成GPT-5的开发并公开发布。此外,OpenAI还计划推出一种新的定价模式,客户通过预付费预定Token,最高可以享受50%的折扣。
此前有曝料,称OpenAI将在近日发布AI搜索引擎。其CEO阿尔特曼对此回应道:“不是GPT-5,也不是搜索引擎,但我们一直在努力开发一些我们认为会得到喜欢的新东西。”
值得注意的是,其竞争对手谷歌的I/O开发者大会时间定在美国时间14日上午10点(北京时间15日凌晨1点),预计可能发布Gemini大模型的重要更新。OpenAI此次发布时间没有定在之前曝料的5月9日,而是“恰好”卡在I/O大会的前一天,火药味可谓浓厚。
要知道,这已经不是OpenAI第一次“卡点”狙击谷歌新品。今年2月,谷歌放出Gemini 1.5 Pro大招,结果没过几个小时,OpenAI就掏出文生视频“王炸”模型Sora,狠狠抢了Gemini 1.5 Pro的风头。
据报道,阿尔特曼的终极目标是开发出类似电影《她》(Her)中,可高度响应的虚拟助手,提升苹果Siri等现有语音助手的可用程度。
OpenAI认为,具有视觉和音频功能的AI语音助手具有像智能手机一样的变革性潜力,理论上其可以做到一系列现在的AI助手无法做到的事,例如充当论文、数学问题指导老师,或是翻译交通标识、帮助解决汽车故障等。
但类似的技术目前所需硬件门槛太高,无法在个人设备上运行,用户可以在短期内使用基于云的版本来获取这些功能,例如自动化客户服务Agent。
OpenAI目前已经推出具备音频转录、文本转语音等功能的软件,不过这些功能是基于独立的对话AI模型实现,而新的语音助手则将这些功能整合在一起。据知情人士透露,该AI语音助手的音频功能能够帮助客服人员更好地理解对方的语气。
目前尚不清楚OpenAI何时向付费客户提供这些新功能,但据试用过该语音助手的人士透露,OpenAI最终的计划是将这些功能都纳入ChatGPT免费版本,目标是比目前其最先进模型GPT-4 Turbo的运行成本更低。该人士还谈道,AI语音助手在有些类型的问题上回答优于GPT-4 Turbo,但仍然存在幻觉问题。
谷歌的AI模型Gemini能实时响应语音命令,并识别图像、视频等。不过这些功能目前仍需要研究人员附以图像和文字说明,且并不能理解许多传统的语音指令,也不能像Siri和谷歌助手等传统语音助手那样与用户对话。
最近几个月,苹果与OpenAI就下一代iPhone操作系统如何整合OpenAI的模型进行了讨论。然而,与此同时,苹果也与谷歌进行着类似的谈判。
这场竞争的最新消息是,据报道,苹果已接近与OpenAI达成协议,将在下一代iPhone操作系统iOS 18中使用ChatGPT;与谷歌尚未达成协议,但谈判仍在进行中。
除了可能在下周推出的AI语音助手外,OpenAI还一直致力于构建一款AI搜索引擎,旨在与谷歌竞争。此外,其也在开发一种被称作“计算机使用Agent”的自动化软件,用来辅助软件开发和其他计算机任务。
阿尔特曼还在与iPhone开发者乔尼·艾维(Jony Ive)合作开发一款独立的AI硬件。然而,最先进的AI模型体积庞大,需要在云端运行,并需要互联网连接才能工作。要使具有视觉和听觉功能的复杂AI模型变得足够小巧,以便在设备上运行,可能需要几个月甚至几年的时间。
不过,大家最关心的可能还是GPT-5。据报道,一位接近OpenAI领导人的人士称,其可能在今年年底完成GPT-5并公开发布。
OpenAI的新产品和AI模型开发工作进展得如火如荼,与此同时,其此前宣布的一些项目却变得不再那么受关注。尽管OpenAI曾向开发者承诺,会在今年第一季度推出GPT Store开发者激励计划,但目前仍没有实现。
在定价方面,据知情人士透露,OpenAI计划推出一种新的定价模式,如果客户通过预付费预定Token,最高可以享受50%的折扣。
这样的优惠形式在云计算领域比较常。