GPT-5发布!OpenAI:博士级专家团队

浏览量:353 时间:2025-08-09 18:00:12 字号:

【导语】北京时间8月8日凌晨,OpenAI震撼发布GPT-5,被誉为迈向通用人工智能的重要里程碑。山姆·奥尔特曼称其为精通各领(lǐng)域的(de)“博(bó)士(shì)级(jí)专(zhuān)家(jiā)”。然(rán)而(ér),发(fā)布(bù)会(huì)后(hòu)评(píng)价(jià)褒(bāo)贬(biǎn)不(bù)一(yī)。GPT-5在(zài)编(biān)程(chéng)、写(xiě)作(zuò)、多(duō)模(mó)态(tài)、医(yī)疗(liáo)咨(zī)询(xún)等(děng)方(fāng)面(miàn)全面(miàn)进(jìn)化(huà),同时引入多种人格模式,商业化策略也颇具竞争力。但PPT翻车与幻觉争议,以及竞争对手的质疑,让这款超级智能模型的未来充满变数。重庆天极网络有限公司带您深入剖析GPT-5的惊艳与争议,探讨其重塑人类与AI关系的潜力。

北京时间8月8日凌晨1点,OpenAI正式发布GPT-5。山姆·奥尔特曼(Sam Altman)称GPT-5是“迈向通用人工智能(AGI)的重要一步”。他还表示,GPT-5就像是一位真正的博士级专家,精通任何你需要的领域。

然而发布(bù)会后大家对于GPT-5的评价直接两极分化,有说超预期的,也有失望“就这?”的。为什么会这样?我们先来看看GPT-5到底升级了啥?

编程、写作、多模态、医疗咨询全面进化

这场一个多小时的发布会,OpenAI的功能展示占据了绝大多数戏份。

首先是编程能力,GPT-5直接刷新了行业天花板,在SWE-Bench Verified(代码修复测试)中得分74.9%,在Aider Polyglot(多语言编程测试)中得分88%,远超前代模型。在发布会上,OpenAI后期训练负责人Yann Dubois现场演示了GPT-5如何根据指令快速生成法语学习、并带有互动游戏的网站,甚至能自动处理交互设计、进度记录等功能。短短几分钟就有这样精致的页面,确实让人惊艳。

多模态理解方面,GPT-5在一系列(liè)多模式基准测试中表现出色,涵盖视觉、基于视频、空间和科学推理。更强的多模态性能意味着,可以更准确地推理图像和其他非文本输入,无论是解释图表,总结演示文稿的照片还是回答有关图表的问题。

写作方面,OpenAI毫不谦虚地称GPT-5为“GPT-5是迄今为止最强大的写作协作工具”。该(gāi)模型能够帮助用户将粗略的想法转化为引人入胜、富有文学深度和节奏感的文字作品。

健康咨询方面,在HealthBench Hard(医疗问答测试)中,GPT-5得分46.2%。OpenAI表示,与以前的模型相比,GPT-5更像是一个积极的思想伙伴,主动标记潜在的问题并提出问题以提供更多有用的答案。OpenAI强调,该模型还提供了更精确和可靠的响应,适应用户的上下文,知识水平和地理位置,使其能够在广泛的场景中提供更安全和更有用的响应。

想象一下,将我们的体检报告上传交给AI来辅助判断,或许能够更好地、更及时地制定诊疗决策。发布会上,OpenAI也邀请了一位同时患有三种癌症的女士分享了经历。这名换着通过上传病例报告到ChatGPT,更好地理解了报告中专业的医疗术语,在确诊初期对于自己面临的情况有了更清晰的理解。甚至由于病情的复杂程度,当专家把治疗决定全交给这位女士时,她选择了GPT来结合海量信息分析报告,并最终辅助这位患者做出了正确的决定。

除了以上升级外,GPT-5还在降低幻觉影响方面取得突破。在启用网页搜索时,GPT-5响应的事实错误率较GPT-4o降低约45%;深度思考模式下,错误率较OpenAI o3降低近80%,大幅减少了“一本正经胡说八道”的情况。更难得的是,GPT-5在严守事实的同时,指令遵循能力跃升,拍马屁的倾向也大大降低。

为了让对话更有趣,GPT-5还引入了批判者(Cynic)、分析者(Robot)、倾听者(zhě)(Listener)和(hé)书(shū)呆(dāi)子(zi)(Nerd)四(sì)种(zhǒng)“人(rén)格(gé)模(mó)式(shì)”供(gōng)用(yòng)户(hù)选(xuǎn)择(zé)。比(bǐ)如(rú)让(ràng)模(mó)型(xíng)以(yǐ)“书(shū)呆(dāi)子(zi)”模(mó)式(shì)详(xiáng)细(xì)解(jiě)释(shì)量(liàng)子(zi)力(lì)学(xué)原(yuán)理(lǐ),或(huò)以(yǐ)“倾(qīng)听(tīng)者(zhě)”模(mó)式(shì)提(tí)供(gōng)情(qíng)感(gǎn)支(zhī)持(chí)。

从(cóng)免(miǎn)费(fèi)用(yòng)户(hù)到(dào)Pro套(tào)餐(cān),API定(dìng)价(jià)竞(jìng)争(zhēng)力(lì)凸(tū)显(xiǎn)

OpenAI的(de)商(shāng)业(yè)化(huà)策(cè)略(è)同(tóng)样(yàng)值(zhí)得(de)关注(zhù)。免费用户可(kě)直(zhí)接(jiē)使(shǐ)用GPT-5(普通版,带推理功能),但每月使用额度有限,触及上限后,系统会自动切换到GPT-5-mini(轻量型);Plus订阅用户除了能使用这些模型外,还享有更高的使用限额。而每月200美元的Pro套餐可无限使用GPT-5,并解锁更强的GPT-5 Pro版本(适合处理复杂任务)和GPT-5 Thinking(延长推理时间)。

对于开发者,OpenAI的API定价也颇具竞(jìng)争(zhēng)力(lì):GPT-5输(shū)入(rù)1.25美(měi)元(yuán)/百(bǎi)万(wàn)tokens,输(shū)出(chū)10美(měi)元(yuán)/百(bǎi)万(wàn)tokens;GPT-5 mini输(shū)入(rù)0.25美(měi)元(yuán)/百(bǎi)万(wàn)tokens,输(shū)出(chū)2美(měi)元(yuán)/百(bǎi)万(wàn)tokens;GPT-5 nano输(shū)入(rù)0.05美(měi)元(yuán)/百(bǎi)万(wàn)tokens,输(shū)出(chū)0.4美(měi)元(yuán)/百(bǎi)万(wàn)tokens。相(xiāng)较(jiào)主要(yào)对(duì)手(shǒu)Anthropic与(yǔ)Google,GPT-5在(zài)不(bù)仅(jǐn)具(jù)备(bèi)竞(jìng)争(zhēng)力(lì),甚(shén)至(zhì)更(gèng)为(wèi)亲(qīn)民(mín)。

性(xìng)能(néng)飞(fēi)跃(yuè)能(néng)否(fǒu)掩(yǎn)盖(gài)PPT翻车与幻觉争议?

既然GPT-5的提升如此(cǐ)显(xiǎn)著(zhe),为(wèi)何(hé)评(píng)价(jià)还(hái)会(huì)两(liǎng)极(jí)分(fēn)化(huà)?先(xiān)说(shuō)说(shuō)发(fā)布(bù)会(huì)上(shàng)出(chū)现(xiàn)的(de)低(dī)级(jí)错(cuò)误(wù),比(bǐ)如(rú)在(zài)介(jiè)绍(shào)GPT-5性(xìng)能(néng)时(shí)OpenAI播(bō)放(fàng)的(de)几(jǐ)页(yè)PPT,实(shí)在(zài)是(shì)让(ràng)人(rén)捉(zhuō)摸(mō)不(bù)透(tòu),这(zhè)神(shén)奇(qí)的(de)图(tú)表(biǎo)也(yě)成(chéng)为(wèi)发(fā)布(bù)会(huì)的(de)一(yī)大(dà)亮(liàng)(槽(cáo))点(diǎn),52.8>69.1,让(ràng)人(rén)质(zhì)疑(yí)OpenAI的(de)严(yán)谨(jǐn)性(xìng)。奥(ào)特(tè)曼(màn)用(yòng)“GPT-6来(lái)改(gǎi)进(jìn)”的(de)调(diào)侃(kǎn)缓(huǎn)解(jiě)尴(gān)尬(gà),但(dàn)网(wǎng)友(you)似(shì)乎(hu)并(bìng)不(bù)买(mǎi)账(zhàng)。除(chú)此(cǐ)之(zhī)外(wài)还(hái)有(yǒu)演(yǎn)示(shì)中(zhōng)神(shén)奇(qí)的(de)大(dà)炮(pào)轨(guǐ)迹(jī)...也(yě)是(shì)让(ràng)人(rén)无(wú)力(lì)吐(tǔ)槽(cáo)。

另(lìng)外(wài),尽(jǐn)管(guǎn)OpenAI表(biǎo)示(shì)GPT-5的(de)幻(huàn)觉(jué)率(lǜ)大(dà)幅(fú)降(jiàng)低(dī),但(dàn)在(zài)实(shí)际(jì)测(cè)试(shì)中(zhōng),模(mó)型(xíng)仍(réng)会(huì)因(yīn)训(xun)练(liàn)数(shù)据(jù)的(de)局(jú)限(xiàn)性(xìng)而(ér)犯(fàn)错(cuò)。官(guān)方(fāng)Demo里(lǐ)“幻(huàn)觉(jué)降(jiàng)低(dī)”的(de)片(piàn)段(duàn),被(bèi)网(wǎng)友(you)揪(jiū)出(chū)了(le)错(cuò)误(wù)。

GPT-5的(de)发(fā)布(bù)并(bìng)未(wèi)让(ràng)竞(jìng)争(zhēng)对(duì)手(shǒu)沉(chén)默(mò)。马斯克也赶来补刀,转发GPT-5在ARC-AGI-2测试中未能击败Grok 4的截图。并表示在今年年底前发布Grok 5。

写在最后:

尽管GPT-5存在争议,但不可否认的是,这款模型正悄然重塑人类与AI的关系——从工具,到伙伴,再到如今潜在的“超级智能”。那么,在你看来这个口袋里的“博士级专家团队”表现是否超预期?

供稿单位:重庆天极网络有限公司

审核专家:李志高 高级工程师/重庆天极网络有限公司总裁

声明:除原创内容及特别说明之外,部分图片来源网络,非商业用途,仅作为科普传播素材,版权归原作者所有,若有侵权,请联系删除。