首页 > 事业编制招聘 > 事业编制招聘 > 9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了

9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了

发布时间:2024-07-19 16:28:18来源: 15210273549

导读

一道小学生的数学题竟然难倒了全球AI大模型,只有4个大模型给出了正确答案!这究竟是怎么一回事?快来看看!

 

全球AI大模型被一道小学生数学题难倒

日前,一道来自小学生的数学题却难倒了不少海内外AI大模型,这道题的内容是“9.11和9.9哪个更大”,而仅有4个大模型给出了正确答案。

 

挑战大模型的数学推理能力

大模型的数学能力一直是短板,即便是目前最好的大模型GPT4也仍然有很大进步空间,而此前笔者在采访12位大模型时也得出了一个惊人的结论,这些大模型中仅有4个回答是正确的,而其他8个大模型却都给出了错误的答案。

 

数字切分问题与模型的理解能力

而针对大模型的数学能力,笔者曾进行过深入的采访,大部分行业人士认为大模型数学能力差的根本原因还是出在分词上,即Tokenizer(分词器)在处理数字时会出现问题,导致模型难以正确理解和计算。

 

正确答案揭晓与未来的发展方向

而这道9.11和9.9的大小比较题,12个大模型中,只有阿里通义千问、百度文心一言、Minimax和腾讯元宝答对,其他8个大模型都认为9.11比9.9更大。

 

虽然最终4个大模型给出了正确答案,但这并不能掩饰大模型数学能力的薄弱,毕竟面对简单的大小比较题,8个大模型都给出了错误答案。

 

而对于未来大模型的发展方向,笔者也咨询了不少专家学者以及从业者,针对此前大模型的回答,不少人表示“并不意外”。

一些专家认为,未来在模型的训练数据上会越来越依赖构造型的数据,而不是直接爬取下来的数据,以提升模型的复杂推理能力。

 

因为直接爬取下来的数据中会夹杂大量的错误数据,这些错误数据会误导模型,导致模型做出错误的判断。

而构造型的数据则可以事先筛选,保证数据的准确性和可靠性,从而培养模型健康的思维方式。

事业编制招聘更多>>

MAZDA EZ-6正式上市,售价13.98万起 新款小鹏G6谍照曝光 大众Scout Traveler亮相 全新雷克萨斯LFR跑车谍照曝光 别克GL8陆尊PHEV,轴距3088mm,值得购买吗? 四驱+2.95秒破百,豪华中大型SUV,路特斯Eletre怎么样? 丰田亚洲龙:大空间+双擎,定位中型车,家用值得一看 吉利牛仔内饰官方图曝光 马自达Skyactiv-G技术到底有什么特别,为何原厂持续使用到现在? 颜值更高!新款2025奇瑞Omoda 5登场,新的外形设计,配备更好! 全新福特Mustang GTD发布,5.2L V8机械增压引擎,马力815匹! 奇瑞Omoda C9发布预告,以独立品牌在马来西亚上市! 吉利银河E5现身吉隆坡道路,从中国出发进行超远程测试! 外媒:蔚来考虑收购奥迪布鲁塞尔工厂?李斌否认! 丰田D-4S :丰田最先进的技术之一、提升动力降低油耗的好帮手? 丰田AE86 G16E Concept来了!只需20,000日元就可体验三个小时! 欧洲消费者更爱HEV车款,混动市占率即将超越燃油车! 丰田Corolla Cross全球销量爆单:2023年累计销量超过700,000辆! 雷克萨斯LX700h来了,搭载3.5升V6混动,还有全时四驱+3把锁 低调内敛的国车,中式豪华,车长5353mm,搭载3.0T/4.0T油电混动 领克“爆款”来了,全新设计理念,轿跑车身打造,风阻系数0.25Cd 大众最经典的两厢车,大量经典设计重现,还搭载1.5T高功率发动机 兰博基尼的王牌,V12发动机+3台电动机,1015匹马力,百公里2.5s 小米高性能电动跑车,碳纤维赛车套件加持,百公里加速破2秒 韩系“大块头”,车长4830mm,搭载2.0T+8AT,247马力、油耗9.38L 又一城市代步车,外观年轻时尚,轴距2750mm,还有100千瓦电动机 原汁原味的德系轿车,车长4773mm,搭载1.4T+6AT,还有双独悬 被忽略的SUV,车长4670mm,搭载1.5T燃油/2.0L混动,还标配双独悬 36小时订单破5000台,腾势Z9GT真的切中了国人的用车需求? 又一重磅大皮卡,郑州日产锐骐6 Pro上市,外观很霸气,两种动力