ChatGPT o1-preview 答错基础数学题 反讽STEM优化宣传

这张图为上下拼接的对比图,上半部分是OpenAI对其o1模型的官方宣传文字,称该模型在STEM(理工科)领域做了特别优化,回答前会进行思考,在物理、生物、化学的GPQA测试中准确性超过人类博士水平;下半部分是第三方ChatGPT站点(plus.aivvm.com)的o1-preview模型对话截图,用户提问「9.11和9.8谁大」,模型思考4秒后给出了错误答案「9.11比9.8大,因为9.11 > 9.8」,而实际9.8大于9.11。两者形成强烈反差,以此反讽o1模型所谓的STEM优化在简单数学题上名不副实,出现低级错误。

对白

用户
9.11和9.8谁大
ChatGPT o1-preview
9.11比9.8大,因为9.11 > 9.8。

文本内容

从OpenAI公布的数据来看,o1在STEM(理工科)领域进行了特别优化,在回答之前会进行思考。在物理、生物和化学问题(GPQA)的基准测试中超越了人类博士水平的准确性。

整体描述

这张图为上下拼接的对比图,上半部分是OpenAI对其o1模型的官方宣传文字,称该模型在STEM(理工科)领域做了特别优化,回答前会进行思考,在物理、生物、化学的GPQA测试中准确性超过人类博士水平;下半部分是第三方ChatGPT站点(plus.aivvm.com)的o1-preview模型对话截图,用户提问「9.11和9.8谁大」,模型思考4秒后给出了错误答案「9.11比9.8大,因为9.11 > 9.8」,而实际9.8大于9.11。两者形成强烈反差,以此反讽o1模型所谓的STEM优化在简单数学题上名不副实,出现低级错误。

来源说明

该图由用户将OpenAI对o1模型的宣传内容,与第三方ChatGPT平台的o1-preview对话截图拼接而成,在科技相关的社交平台(如微博、知乎、Reddit等)流传,用来调侃AI模型在基础问题上的失误,质疑其宣传的STEM能力。对话截图来自站点plus.aivvm.com,这是一个非官方的ChatGPT镜像站点。

相似的梗图

超本科线10分纠结冲一本捡漏211却被建议读大专的搞笑评论对话

这是一张社交媒体内容截图,上半部分是用户发布的提问:高...

聊天中从关心学业突转冒犯性私密提问

这是一张竖屏的手机聊天记录静态截图,对话双方先是围绕高...

转学生考第一,全校第一要“铁棍决斗”

这是一张微博截图梗图,内容讲述一个转学生第一次考试就考...

程序员优化完APK后获得客户夸赞的聊天记录截图

这是一张竖屏的手机聊天界面截图,聊天双方均使用穿黑色西...

ChatGPT生成夸赞豆包生图更强的虚拟B站评论截图

这是一张ChatGPT移动端的对话界面截图,用户向Ch...

网友对被曝光缺德教师的分类观察

这是一张微博平台的用户发布内容截图,带有黄V认证的用户...

ChatGPT与篠澤広的奇妙对比

这是一张多图拼接的图文混排梗图,通过左右/上下对比的方...

意大利科研团队光转固体研究引争议评论

图片显示一个视频播放界面,暂停在00:34处。视频内容...

B站UP主庄不纯宣布Steam电子扫盲课停更,因观众重复提问已讲内容

这是哔哩哔哩(B站)平台的视频评论区截图,UP主「庄不...

豆包AI服务过载时博士生的自嘲求助对话

这是一张豆包AI助手的聊天界面截图。界面顶部显示“豆包...

豆包误解用户吐槽误将脏话谐音当成抽到原神草神纳西妲

这是一张豆包AI的聊天界面截图,用户先发送了一道大学物...

网文作者用AI写文翻车,AI把骂读者的要求写进正文

这是一张网文论坛「网文江湖」的帖子截图,楼主「我真是扑...

梗图网

梗图网

打开手机 App,找梗更快

下载