初探 OpenAI GPT-4.1 性能:AI 编程能力大增,但谷歌 Gemini 依然称王

发布时间:2025-04-28 13:04:03 来源:互联网

本站 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4.1 系列模型,其性能相比 GPT-4o 虽然实现重大飞跃,但多项跑分未能超越谷歌的 Gemini 系列。

本站昨日报道,OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分数据来看,这些模型在编程方面的能力,远超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中,GPT-4o 的得分为 21.4%,GPT-4.5 的得分为 26.6%,而 GPT-4.1 的得分为 54.6%。

尽管性能有较大提升,不过根据多位专家测试,相比较谷歌的 Gemini 系列,GPT-4.1 对比中却显露劣势。

根据 Stagehand(一款生产级浏览器自动化框架)发布的基准数据,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快。相比之下,GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。

此外,哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。

在编码专项测试中,GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示,GPT-4.1 的编码得分仅为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先。

值得注意的是,GPT-4.1 被归类为非推理模型(non-reasoning model),但其编码能力仍属行业顶尖。

本周热门教程

1
戴尔首款 OLED 显示器 S3225QC 国行上市:31.6 英寸 4K 120Hz 面板 + AI 3D 空间音频,6499 元

戴尔首款 OLED 显示器 S3225QC 国行上市:31.6 英寸 4K 120Hz 面板 + AI 3D 空间音频,6499 元

2025/04/18

2
惠普暗影精灵 11 台式机新增“i7-14700F + 32G + 1T + RTX5070”配置售 13999 元

惠普暗影精灵 11 台式机新增“i7-14700F + 32G + 1T + RTX5070”配置售 13999 元

2025/04/03

3
崩坏星穹铁道星铁world活动怎么玩-崩坏星穹铁道星铁world活动玩法介绍

崩坏星穹铁道星铁world活动怎么玩-崩坏星穹铁道星铁world活动玩法介绍

2025/04/18

4
三星球形投影机器人专利公示,变革家庭娱乐

三星球形投影机器人专利公示,变革家庭娱乐

2025/04/15

5
崩坏星穹铁道风堇立绘图片-崩坏星穹铁道风堇高清立绘壁纸图片大全

崩坏星穹铁道风堇立绘图片-崩坏星穹铁道风堇高清立绘壁纸图片大全

2025/04/18

6
世界最高双层悬索桥:我国“狮子洋大桥”索塔突破 100 米

世界最高双层悬索桥:我国“狮子洋大桥”索塔突破 100 米

2025/04/05

7
《刺客信条:影》火爆上线,创系列新高,延期发售策略显明智?

《刺客信条:影》火爆上线,创系列新高,延期发售策略显明智?

2025/04/15

8
新增车载接口不间断供电功能,特斯拉汽车海外获 2025 年春季更新

新增车载接口不间断供电功能,特斯拉汽车海外获 2025 年春季更新

2025/04/18

9
如何避免误解和处理情感冲突:建立健康人际关系的五大秘诀

如何避免误解和处理情感冲突:建立健康人际关系的五大秘诀

2025/04/07

10
《神秘岛》开发工作室Cyan Worlds痛裁半数员工,游戏开发业寒冬加剧

《神秘岛》开发工作室Cyan Worlds痛裁半数员工,游戏开发业寒冬加剧

2025/04/06