4 月 16 日消息,科技媒體 bleepingcomputer 昨日(4 月 15 日)發布博文,報道稱 OpenAI 最新發布的 GPT-4.1 系列模型,其性能相比 GPT-4o 雖然實現重大飛躍,但多項跑分未能超越谷歌的 Gemini 系列。
昨日報道,OpenAI 公司發布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分數據來看,這些模型在編程方面的能力,遠超 GPT-4o 及 GPT-4o mini。
例如在 SWE-bench Verified 跑分中,GPT-4o 的得分為 21.4%,GPT-4.5 的得分為 26.6%,而 GPT-4.1 的得分為 54.6%。
盡管性能有較大提升,不過根據多位專家測試,相比較谷歌的 Gemini 系列,GPT-4.1 對比中卻顯露劣勢。
根據 Stagehand(一款生產級瀏覽器自動化框架)發布的基準數據,Gemini 2.0 Flash 的錯誤率僅為 6.67%,精確匹配率高達 90%,且價格低廉、速度更快。相比之下,GPT-4.1 的錯誤率高達 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。
此外,哈佛大學 RNA 科學家 Pierre Bongrand 提供的數據也指出,GPT-4.1 的性價比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等競品。
在編碼專項測試中,GPT-4.1 同樣未能占據上風。Aider Polyglot 的測試結果顯示,GPT-4.1 的編碼得分僅為 52%,而 Gemini 2.5 則以 73% 的成績遙遙領先。
值得注意的是,GPT-4.1 被歸類為非推理模型(non-reasoning model),但其編碼能力仍屬行業頂尖。
本文鏈接:http://www.tebozhan.com/showinfo-45-12352-0.html初探 OpenAI GPT-4.1 性能:AI 編程能力大增,但谷歌 Gemini 依然稱王
聲明:本網頁內容旨在傳播知識,若有侵權等問題請及時與本網聯系,我們將在第一時間刪除處理。郵件:2376512515@qq.com
上一篇: OpenAI 的 GPT - 4.1 無安全報告,AI 安全透明度再遭質疑
下一篇: 消息稱蘋果 watchOS 12 將引入 Apple Intelligence 功能,依賴 iPhone 運行模型