誰是中國(guó)最聰明的大模型?MIT科技評(píng)論:訊飛星火排名第一
2023-08-18 09:09:30 來源:大皖新聞
大皖新聞?dòng)?/strong>誰是中國(guó)最聰明的認(rèn)知大模型?8月17日,《麻省理工科技評(píng)論》中國(guó)最新發(fā)布的大模型評(píng)測(cè)報(bào)告給出了答案。 報(bào)告顯示,在8個(gè)一級(jí)大類的600道題目的測(cè)試和盲評(píng)中,訊飛星火認(rèn)知大模型V2.0在6個(gè)大類中得分率排名第一,在此次評(píng)測(cè)中表現(xiàn)突出,以 81.5 分(百分制計(jì))的成績(jī)?cè)诒敬卧u(píng)測(cè)中登頂,榮獲“最聰明”的國(guó)產(chǎn)大模型稱號(hào)。
大模型評(píng)測(cè)綜合得分率
《麻省理工科技評(píng)論》中國(guó)從研發(fā)和商業(yè)化能力、外界態(tài)度以及發(fā)展趨勢(shì)等維度全方位檢測(cè)大模型的能力,力圖評(píng)出“最聰明”的國(guó)產(chǎn)大模型。選取了“訊飛星火”、“百度文心一言”、“商湯商量”、“阿里通義千問”作為中文大模型平臺(tái)的代表,展開系統(tǒng)、科學(xué)的評(píng)測(cè)。
【資料圖】
4個(gè)大模型各項(xiàng)能力雷達(dá)圖
本次評(píng)測(cè)使用的測(cè)試集包含600道題目,覆蓋了語言專項(xiàng)、數(shù)學(xué)專項(xiàng)、理科綜合、文科綜合、邏輯思維、編程能力、綜合知識(shí)、安全性共 8 個(gè)一級(jí)大類,126 個(gè)二級(jí)分類,290 個(gè)三級(jí)標(biāo)簽,并針對(duì)問題的豐富性和多樣性做了優(yōu)化。
在題目類型上,為了兼顧定量、定性的評(píng)價(jià)與測(cè)試,設(shè)置了“單選”、“多選”、“填空”、“簡(jiǎn)答”4個(gè)題型,分別有 145 道、138 道、136 道和 181 道。大模型評(píng)測(cè)體系使用盲評(píng)方式,客觀評(píng)估國(guó)產(chǎn)大模型的聰明程度。
作為“最聰明”的大模型的基礎(chǔ)能力,語言專項(xiàng)評(píng)測(cè)包含對(duì)話理解、多語種、諷刺、古詩詞理解、文本生成、要點(diǎn)總結(jié)、情感分析、語義判斷等 61 個(gè)二級(jí)分類,題型則以簡(jiǎn)答為主。結(jié)果顯示,訊飛星火 85.73%的得分率排名第一,明顯高于平均值。
數(shù)學(xué)專項(xiàng)評(píng)測(cè),是“最聰明”大模型必不可少的評(píng)測(cè)維度。本次評(píng)測(cè)包含代數(shù)、幾何、解方程、復(fù)雜數(shù)學(xué)、統(tǒng)計(jì)學(xué)等 9 個(gè)二級(jí)分類,以選擇題為主。
其中,訊飛星火以 77.75% 的得分率名列第一,遠(yuǎn)高于平均得分率 56%,其他平臺(tái)得分率基本相當(dāng)。報(bào)告稱,在大模型普遍“數(shù)學(xué)不好”的情況下,訊飛星火這一成績(jī)頗為難得,其在數(shù)學(xué)專項(xiàng)上的領(lǐng)先同樣體現(xiàn)在二級(jí)分類的評(píng)分結(jié)果上,在 77.8%的二級(jí)分類中得分率第一,遠(yuǎn)超其他平臺(tái),初步判斷其擅長(zhǎng)幾何與情景應(yīng)用。
作為體現(xiàn)大模型“聰明程度”不可或缺的“硬核”部分,理科綜合評(píng)測(cè)包含表格問答、化學(xué)、生物、物理、醫(yī)學(xué) 5 個(gè)二級(jí)分類,題型上以單選和簡(jiǎn)答為主。
評(píng)測(cè)結(jié)果中,訊飛星火 78.50% 的得分率排名第一。另外,訊飛星火在理科綜合大類下 80% 的二級(jí)分類評(píng)測(cè)中得分率為第一,化學(xué)與生物較為突出。
邏輯思維也是“最聰明”大模型的重要體現(xiàn),本次邏輯思維評(píng)測(cè)在邏輯推理、思維鏈等方面設(shè)計(jì)了較多的題目,包含類比、常識(shí)推理、空間方位、演繹推理、邏輯謬誤檢測(cè)、因果推理等 19 個(gè)二級(jí)分類,題型上相對(duì)平均,其中填空題最多,多選題最少。
在邏輯思維題目中,訊飛星火 81.25%的得分率名列第一,明顯高于 72.6% 的平均值。此外,訊飛星火在邏輯思維 63.2% 的二級(jí)分類問題上得分率第一。
編程能力是大模型比較高階的能力,本次的編程能力評(píng)測(cè)包含 ASCII、ASCII碼識(shí)別、Python、代碼、代碼修正、計(jì)算機(jī) 6 個(gè)二級(jí)分類,其中 Python 主要以簡(jiǎn)答形式評(píng)估大模型的代碼生成能力和正確率,其他則以客觀題的形式考察。
結(jié)果顯示,訊飛星火 80% 的得分率明顯高于 71%的平均值,其他平臺(tái)得分率基本相當(dāng)。值得一提的是,在許多人關(guān)心的生成代碼的簡(jiǎn)答題單項(xiàng)上,訊飛星火的得分率高達(dá) 82%,遠(yuǎn)高于其他平臺(tái)。
作為比較難的評(píng)測(cè)維度,綜合知識(shí)對(duì)大模型的“聰明”程度要求也很高,涉及的題目較雜,包含百科問答、常識(shí)、科學(xué)知識(shí)、事實(shí)問答、工作技巧、謎語等 13 個(gè)二級(jí)分類,題型以多選為主。
在綜合知識(shí)評(píng)測(cè)上,訊飛星火 80.61% 的得分率排名第一,在 84.6% 的二級(jí)分類上得分率第一。
報(bào)告指出,在本輪大模型評(píng)測(cè)中,訊飛星火以 81.5 分的成績(jī)拔得頭籌,成為“最聰明”的國(guó)產(chǎn)大模型。
值得注意的是,訊飛星火在編程能力、理科綜合、邏輯思維、數(shù)學(xué)專項(xiàng)、語言專項(xiàng)和綜合知識(shí)這 6 個(gè)一級(jí)大類中得分率排名第一,在此次評(píng)測(cè)中表現(xiàn)十分全面,尤其是在代碼生成、數(shù)學(xué)能力、理科與邏輯等方面優(yōu)勢(shì)明顯,是本次“最聰明的理科生”。
大皖新聞?dòng)浾?項(xiàng)磊
編輯 陶娜
關(guān)鍵詞:
相關(guān)閱讀
- (2023-08-18)誰是中國(guó)最聰明的大模型?MIT科技評(píng)論:訊飛星火排名第一
- (2023-08-18)轉(zhuǎn)會(huì)1+2:利物浦中場(chǎng)引援關(guān)注6大目標(biāo) 巴薩天才拒當(dāng)替補(bǔ)將轉(zhuǎn)會(huì)
- (2023-08-18)淘氣包馬小跳 300字讀后感優(yōu)秀作文
- (2023-08-18)燃!東部戰(zhàn)區(qū)發(fā)布戰(zhàn)訓(xùn)MV《閱海峽》
- (2023-08-18)北交所過會(huì)未拿文企業(yè)8家
- (2023-08-18)官橋鎮(zhèn):防溺水宣傳不放松
- (2023-08-18)鱷魚的天敵是誰(鱷魚的天敵)
- (2023-08-18)大反攻!消費(fèi)牛了,周黑鴨多賺453%
- (2023-08-18)報(bào)告顯示:廣東數(shù)字經(jīng)濟(jì)發(fā)展指數(shù)位居全國(guó)前列
- (2023-08-18)因油價(jià)上漲,8月18日起杭州市區(qū)出租車將收取1元燃油附加費(fèi)
- (2023-08-18)創(chuàng)新技術(shù)篇:南威云盾隱私計(jì)算,護(hù)航數(shù)據(jù)要素流通安全
- (2023-08-18)拼出海底沉睡的歲月——“80后”女文保工作者的“海撈瓷”故事
- (2023-08-18)寧德時(shí)代發(fā)布神行超充電池 有望推動(dòng)“電器件”迭代換新
- (2023-08-18)截至7月末私募基金管理規(guī)模達(dá)20.82萬億元
- (2023-08-18)泉為科技:8月17日召開董事會(huì)會(huì)議
- (2023-08-18)甘肅通渭:以節(jié)促旅書香濃
- (2023-08-18)昊海生物科技(06826.HK)中期凈利2.05億元 同比增長(zhǎng)188.94%
- (2023-08-18)學(xué)圃齋前古梅兩干蠹傷其一賦此(關(guān)于學(xué)圃齋前古梅兩干蠹傷其一賦此簡(jiǎn)述)
- (2023-08-18)車上顯示lkas是什么意思(汽車上lkas是什么意思?)
- (2023-08-18)怎么打中間的圓點(diǎn) 中間的圓點(diǎn)
- (2023-08-18)蜘蛛俠暗影之網(wǎng)怎么變黑蜘蛛 蜘蛛俠暗影之網(wǎng)怎么調(diào)中文
- (2023-08-18)贈(zèng)書簽名范例 贈(zèng)書
- (2023-08-18)數(shù)據(jù)驚人!53場(chǎng)52球&三冠王,哈蘭德能奪今年金球獎(jiǎng)嗎?
- (2023-08-18)2014年九月份瑞鷹車型價(jià)格及豪華選擇
- (2023-08-18)河北前十名易經(jīng)大師 出自衡水地域的四位八卦掌名家)
- (2023-08-18)2023天津初中開學(xué)時(shí)間(寒假+暑假)
- (2023-08-18)英雄聯(lián)盟1316版本正式服女警加強(qiáng)了什么
- (2023-08-18)董蕓(關(guān)于董蕓簡(jiǎn)述)
- (2023-08-18)蔡翰維(關(guān)于蔡翰維簡(jiǎn)述)