安全讨论持续的同时,人工智能巨头争夺用户与应用市场的竞争仍在继续。当地时间9月22日,OpenAI与Anthropic在相隔约一个半小时的时间内先后发布新模型。与此前频繁以刷新能力上限作为主要卖点不同,此次两家公司都将重点放在了降低推理成本、提升速度以及扩大实际使用规模上。这或许也反映出,当模型能力逐渐逼近天花板,单纯刷新性能已经越来越难以解释产品价值,实际任务成本开始成为模型竞争的重要指标。

更低成本
当天,OpenAI率先发布GPT-6 Sol和GPT-6 Luna,称两款模型继承了GPT-6 Astra的部分能力,并通过改进缓存和推理效率降低成本。官方表示,两款模型的API价格较GPT-5.6此前的促销价格下降50%。
目前GPT-6 Astra仍是OpenAI用于最复杂推理和编码任务的旗舰模型,Sol定位于复杂编码和Agent工作流,Luna则面向成本敏感、高调用量的任务。OpenAI称,GPT-6 Sol和Luna在智能、对齐、编码、计算机使用等方面均较GPT-5.6对应产品有所改进,且API价格永久下降50%,从而使更多应用场景具备经济可行性。
约一个半小时后,Anthropic发布Claude Opus 5.5。这是Claude 5.5系列的首款模型。
Anthropic称,Opus 5.5在大多数任务上的表现达到Claude Fable 5.1水平,但运行成本较上一代Opus 5降低40%;输入和输出Token(词元)价格分别下降20%,缓存读取价格下降60%,生成速度提高超过30%。
价格打下来,两家公司并没有停止追求模型性能。Anthropic公布的测试数据显示,Opus 5.5在Terminal-Bench 4.0等编程测试中超过Opus 5和Fable 5.1,并在部分测试中超过GPT-6 Astra。Anthropic承认,随着模型能力接近,基准测试分数之间的微小差距越来越难以直接代表真实使用体验。
但来自开发者社区的反馈声音褒贬不一。GPT-6 Sol发布后,AI编程社区创始人韦斯·温德(Wes Winder)质疑称,Sol在DeepSWE测试中的表现低于GPT-5.6 Sol,新模型并非在所有指标上都实现提升。
对此,OpenAI核心产品负责人蒂博·索蒂奥(Thibault Sottiaux,Tibo)回应称,Sol是“各方面都更好的模型”,重点在于综合体验和效率,而不是追求单项基准的极限成绩。对于这个说法,温德并不买账,他称:如果高端产品反而更差,为什么整体性能会更好?在基准测试中表现出色并不代表什么,但在基准测试中表现糟糕却意义重大。
安全优先
此次两家公司降价提供更高性能模型的背后,是行业趋势的变化。有业内分析指出,安全的重要性正越过模型性能,同时中国开源模型凭借更优性价比占领更多的市场份额,倒逼美国模型厂商在数月前也开始走性价比路线。
Anthropic特别强调,Opus 5.5是其呼吁放缓前沿AI发展节奏后首次发布的模型,发布前接受了Frontier Design、METR等外部评估机构的测试。在其覆盖最全面的对齐测试中,Opus 5.5成为受测模型中表现最好的,并配备了此前为旗下能力最强模型开发的安全防护措施。
具体防护上,Opus 5.5配备执行前检查每项操作的分类器、可供安全团队审查的开源沙箱,以及在代码合并前发现漏洞的审查功能。Anthropic还表示,在AI安全公司Gray Swan开展的一项基准测试中,Opus 5.5与Fable 5.1并列成为受测模型中提示词注入攻击成功率最低的模型。
此前,Anthropic CEO达里奥·阿莫迪(Dario Amodei)发长文呼吁放缓模型能力的推进速度,为安全研究和风险治理争取更多时间。OpenAI CEO山姆·奥尔特曼(Sam Altman)随后表达了支持,马斯克也转发达里奥的文章表示认同。
另一方面,OpenAI近期已在调整相关披露与外部评估机制。当地时间9月16日,OpenAI宣布调整安全问题披露机制,并主动公布多起模型编造数据、智能体未经授权操作案例。当地时间9月21日,OpenAI再次发布博文称,一款自8月28日开始训练的内部模型,已解决数学多个领域的百余项难题。OpenAI还同时宣布与数学家成立独立顾问组合作,就研究成果的评估、审查和发布等提供建议。不过,OpenAI也明确划定了这一外部咨询机制的边界:顾问组不负责就其研究的推进速度提供建议。
综合竞争
从公开发布节奏看,两家公司的产品迭代仍较为密集。此次上新距离OpenAI发布GPT-6 Astra仅19天,距离Anthropic发布Claude Fable 5.1和Mythos 5.1也仅21天。不过,产品发布频率并不能直接等同于前沿能力的研发速度,仅凭此次上新尚不足以判断其“减速”呼吁是否已转化为研发节奏的实际调整。
值得一提的是,马斯克日前在公开活动上澄清称,他认同的是达里奥关于AI存在重大安全风险这一判断,并非认可其提出的AI研发减速与监管方案。他还指出,“当OpenAI和Anthropic的人告诉我们他们的模型极度危险时,我们应当相信他们说的是真话。但他们一边说着有10%的概率会毁灭人类,一边又去问投资者在IPO里想要认购多少份额。这简直就像在玩某种疯狂的四维象棋”。
在天使投资人、人工智能专家郭涛看来,放慢前沿开发并不意味着停止模型迭代,头部公司仍在持续推进模型能力,只是竞争重点从过去单纯争夺“谁的模型更强”,逐渐转向谁能以更低成本、更快速度,把接近前沿水平的能力部署到更多真实任务中。
郭涛表示,AI模型行业的下一阶段竞争不再只是能力上限的竞争,而是能力、成本、速度和规模化应用效率的综合竞争。对于开发者和企业而言,模型是否能够以更低成本完成一次编程、研究或Agent任务,比随时会被推翻的榜单分数更为重要。
北京商报记者 赵天舒
本网站所有内容属北京商报社有限公司,未经许可不得转载。 商报总机:010-64101978 版权合作:010-64101871
商报地址:北京市朝阳区和平里西街21号 邮编:100013 法律顾问:北京市中同律师事务所(010-82011988)
![]()
网上有害信息举报 违法和不良信息举报电话:010-84276691 举报邮箱:bjsb@bbtnews.com.cn
ICP备案编号:京ICP备08003726号-1
京公网安备11010502045556号 互联网新闻信息服务许可证11120220001号