如何看待机器之心重测高考数学全卷,Gemini夺冠,豆包DeepSeek并列第二?
- 发表时间:2025-06-20 12:55:17
- 来源:
当务之急最该解决的问题是大众对于 AI大模型的正确认知以及最基本的AI用法。
你看这是前两天的测试结果,突出了一个政治正确,6款大模型,OpenAI的o3倒数第一,我当时看到的时候就觉得很奇怪,o3好歹也是曾经的一代王者,高考数学这种题它排名这么低怕不是有什么猫腻。
我们就拿单选题的第五题来测试下,因为这道题除了o3,其他的国产模型都答对了。
这是第五题的原题,正确答案是A. - 1/2。
这是之前的第三方的测试结果,6个模型…。
推荐资讯
- 2025-06-20 02:25:15在excel中,如何利用VBA将这段数据转成json格式?
- 2025-06-20 02:00:15Gemini 2.5 Flash 和Pro稳定版上线,和之前版本相比,在性能和应用场景上有哪些提升?
- 2025-06-20 01:40:15人为什么需要睡觉?人睡觉的时候身体都在做什么?
- 2025-06-20 02:05:15如何看待rust编写的zed编辑器?
- 2025-06-20 01:40:15如何评价前端框架 Solid?
- 2025-06-20 01:40:15Gradle 是否已经对安卓的发展构成了阻碍?
- 2025-06-20 01:15:16为什么江苏省的GDP一直没有广东高?
- 2025-06-20 00:55:16MacOS真的比Windows流畅吗?
- 2025-06-20 02:15:16印度是真的烂还是咱们在信息茧房里面?
- 2025-06-20 02:20:156月18日,中国女篮 101-92 胜日本女篮,张子宇 18 分韩旭18+11,如何评价本场比赛?
推荐产品
-
海贼王为什么现在被全网黑?
海贼王的基本盘崩了 要知道,海贼王一开始就是一个小短篇,这个 -
你后悔买领克了吗?
非常后悔!还在维权 本人领克车主,2024年8月底在西安永利 -
和女生旅游开一间房有什么注意事项?
背包旅行时,我和许多女生拼过房。 第一次在武夷山住青旅,我 -
全平台应用框架会是趋势吗?flutter、tauri、maui你更看好哪一个?
趁着国庆前夕,分享一款最新原创研发的跨平台 tauri2.0
新闻动态
最新资讯