誰是中國(guó)最聰明的大模型？MIT科技評(píng)論：訊飛星火排名第一

2023-08-18 09:09:30 來源：大皖新聞

評(píng)論

大皖新聞?dòng)?/strong>誰是中國(guó)最聰明的認(rèn)知大模型？8月17日，《麻省理工科技評(píng)論》中國(guó)最新發(fā)布的大模型評(píng)測(cè)報(bào)告給出了答案。報(bào)告顯示，在8個(gè)一級(jí)大類的600道題目的測(cè)試和盲評(píng)中，訊飛星火認(rèn)知大模型V2.0在6個(gè)大類中得分率排名第一，在此次評(píng)測(cè)中表現(xiàn)突出，以 81.5 分（百分制計(jì)）的成績(jī)?cè)诒敬卧u(píng)測(cè)中登頂，榮獲“最聰明”的國(guó)產(chǎn)大模型稱號(hào)。

大模型評(píng)測(cè)綜合得分率

《麻省理工科技評(píng)論》中國(guó)從研發(fā)和商業(yè)化能力、外界態(tài)度以及發(fā)展趨勢(shì)等維度全方位檢測(cè)大模型的能力，力圖評(píng)出“最聰明”的國(guó)產(chǎn)大模型。選取了“訊飛星火”、“百度文心一言”、“商湯商量”、“阿里通義千問”作為中文大模型平臺(tái)的代表，展開系統(tǒng)、科學(xué)的評(píng)測(cè)。

【資料圖】

4個(gè)大模型各項(xiàng)能力雷達(dá)圖

本次評(píng)測(cè)使用的測(cè)試集包含600道題目，覆蓋了語言專項(xiàng)、數(shù)學(xué)專項(xiàng)、理科綜合、文科綜合、邏輯思維、編程能力、綜合知識(shí)、安全性共 8 個(gè)一級(jí)大類，126 個(gè)二級(jí)分類，290 個(gè)三級(jí)標(biāo)簽，并針對(duì)問題的豐富性和多樣性做了優(yōu)化。

在題目類型上，為了兼顧定量、定性的評(píng)價(jià)與測(cè)試，設(shè)置了“單選”、“多選”、“填空”、“簡(jiǎn)答”4個(gè)題型，分別有 145 道、138 道、136 道和 181 道。大模型評(píng)測(cè)體系使用盲評(píng)方式，客觀評(píng)估國(guó)產(chǎn)大模型的聰明程度。

作為“最聰明”的大模型的基礎(chǔ)能力，語言專項(xiàng)評(píng)測(cè)包含對(duì)話理解、多語種、諷刺、古詩詞理解、文本生成、要點(diǎn)總結(jié)、情感分析、語義判斷等 61 個(gè)二級(jí)分類，題型則以簡(jiǎn)答為主。結(jié)果顯示，訊飛星火 85.73%的得分率排名第一，明顯高于平均值。

數(shù)學(xué)專項(xiàng)評(píng)測(cè)，是“最聰明”大模型必不可少的評(píng)測(cè)維度。本次評(píng)測(cè)包含代數(shù)、幾何、解方程、復(fù)雜數(shù)學(xué)、統(tǒng)計(jì)學(xué)等 9 個(gè)二級(jí)分類，以選擇題為主。

其中，訊飛星火以 77.75% 的得分率名列第一，遠(yuǎn)高于平均得分率 56%，其他平臺(tái)得分率基本相當(dāng)。報(bào)告稱，在大模型普遍“數(shù)學(xué)不好”的情況下，訊飛星火這一成績(jī)頗為難得，其在數(shù)學(xué)專項(xiàng)上的領(lǐng)先同樣體現(xiàn)在二級(jí)分類的評(píng)分結(jié)果上，在 77.8%的二級(jí)分類中得分率第一，遠(yuǎn)超其他平臺(tái)，初步判斷其擅長(zhǎng)幾何與情景應(yīng)用。

作為體現(xiàn)大模型“聰明程度”不可或缺的“硬核”部分，理科綜合評(píng)測(cè)包含表格問答、化學(xué)、生物、物理、醫(yī)學(xué) 5 個(gè)二級(jí)分類，題型上以單選和簡(jiǎn)答為主。

評(píng)測(cè)結(jié)果中，訊飛星火 78.50% 的得分率排名第一。另外，訊飛星火在理科綜合大類下 80% 的二級(jí)分類評(píng)測(cè)中得分率為第一，化學(xué)與生物較為突出。

邏輯思維也是“最聰明”大模型的重要體現(xiàn)，本次邏輯思維評(píng)測(cè)在邏輯推理、思維鏈等方面設(shè)計(jì)了較多的題目，包含類比、常識(shí)推理、空間方位、演繹推理、邏輯謬誤檢測(cè)、因果推理等 19 個(gè)二級(jí)分類，題型上相對(duì)平均，其中填空題最多，多選題最少。

在邏輯思維題目中，訊飛星火 81.25%的得分率名列第一，明顯高于 72.6% 的平均值。此外，訊飛星火在邏輯思維 63.2% 的二級(jí)分類問題上得分率第一。

編程能力是大模型比較高階的能力，本次的編程能力評(píng)測(cè)包含 ASCII、ASCII碼識(shí)別、Python、代碼、代碼修正、計(jì)算機(jī) 6 個(gè)二級(jí)分類，其中 Python 主要以簡(jiǎn)答形式評(píng)估大模型的代碼生成能力和正確率，其他則以客觀題的形式考察。

結(jié)果顯示，訊飛星火 80% 的得分率明顯高于 71%的平均值，其他平臺(tái)得分率基本相當(dāng)。值得一提的是，在許多人關(guān)心的生成代碼的簡(jiǎn)答題單項(xiàng)上，訊飛星火的得分率高達(dá) 82%，遠(yuǎn)高于其他平臺(tái)。

作為比較難的評(píng)測(cè)維度，綜合知識(shí)對(duì)大模型的“聰明”程度要求也很高，涉及的題目較雜，包含百科問答、常識(shí)、科學(xué)知識(shí)、事實(shí)問答、工作技巧、謎語等 13 個(gè)二級(jí)分類，題型以多選為主。

在綜合知識(shí)評(píng)測(cè)上，訊飛星火 80.61% 的得分率排名第一，在 84.6% 的二級(jí)分類上得分率第一。

報(bào)告指出，在本輪大模型評(píng)測(cè)中，訊飛星火以 81.5 分的成績(jī)拔得頭籌，成為“最聰明”的國(guó)產(chǎn)大模型。

值得注意的是，訊飛星火在編程能力、理科綜合、邏輯思維、數(shù)學(xué)專項(xiàng)、語言專項(xiàng)和綜合知識(shí)這 6 個(gè)一級(jí)大類中得分率排名第一，在此次評(píng)測(cè)中表現(xiàn)十分全面，尤其是在代碼生成、數(shù)學(xué)能力、理科與邏輯等方面優(yōu)勢(shì)明顯，是本次“最聰明的理科生”。

大皖新聞?dòng)浾?項(xiàng)磊

編輯陶娜

關(guān)鍵詞：

[責(zé)任編輯：]

相關(guān)閱讀

(2023-08-18)誰是中國(guó)最聰明的大模型？MIT科技評(píng)論：訊飛星火排名第一

(2023-08-18)轉(zhuǎn)會(huì)1+2：利物浦中場(chǎng)引援關(guān)注6大目標(biāo) 巴薩天才拒當(dāng)替補(bǔ)將轉(zhuǎn)會(huì)

(2023-08-18)淘氣包馬小跳 300字讀后感優(yōu)秀作文

(2023-08-18)燃！東部戰(zhàn)區(qū)發(fā)布戰(zhàn)訓(xùn)MV《閱海峽》

(2023-08-18)北交所過會(huì)未拿文企業(yè)8家

(2023-08-18)官橋鎮(zhèn)：防溺水宣傳不放松

(2023-08-18)鱷魚的天敵是誰（鱷魚的天敵）

(2023-08-18)大反攻！消費(fèi)牛了，周黑鴨多賺453%

(2023-08-18)報(bào)告顯示：廣東數(shù)字經(jīng)濟(jì)發(fā)展指數(shù)位居全國(guó)前列

(2023-08-18)因油價(jià)上漲，8月18日起杭州市區(qū)出租車將收取1元燃油附加費(fèi)

(2023-08-18)創(chuàng)新技術(shù)篇：南威云盾隱私計(jì)算，護(hù)航數(shù)據(jù)要素流通安全

(2023-08-18)拼出海底沉睡的歲月——“80后”女文保工作者的“海撈瓷”故事

(2023-08-18)寧德時(shí)代發(fā)布神行超充電池有望推動(dòng)“電器件”迭代換新

(2023-08-18)截至7月末私募基金管理規(guī)模達(dá)20.82萬億元

(2023-08-18)泉為科技：8月17日召開董事會(huì)會(huì)議

(2023-08-18)甘肅通渭：以節(jié)促旅書香濃

(2023-08-18)昊海生物科技(06826.HK)中期凈利2.05億元同比增長(zhǎng)188.94%

(2023-08-18)學(xué)圃齋前古梅兩干蠹傷其一賦此(關(guān)于學(xué)圃齋前古梅兩干蠹傷其一賦此簡(jiǎn)述)

(2023-08-18)車上顯示lkas是什么意思（汽車上lkas是什么意思？）

(2023-08-18)怎么打中間的圓點(diǎn) 中間的圓點(diǎn)

(2023-08-18)蜘蛛俠暗影之網(wǎng)怎么變黑蜘蛛蜘蛛俠暗影之網(wǎng)怎么調(diào)中文

(2023-08-18)贈(zèng)書簽名范例贈(zèng)書

(2023-08-18)數(shù)據(jù)驚人！53場(chǎng)52球&三冠王，哈蘭德能奪今年金球獎(jiǎng)嗎？

(2023-08-18)2014年九月份瑞鷹車型價(jià)格及豪華選擇

(2023-08-18)河北前十名易經(jīng)大師出自衡水地域的四位八卦掌名家）

(2023-08-18)2023天津初中開學(xué)時(shí)間（寒假+暑假）

(2023-08-18)英雄聯(lián)盟1316版本正式服女警加強(qiáng)了什么

(2023-08-18)董蕓(關(guān)于董蕓簡(jiǎn)述)

(2023-08-18)蔡翰維(關(guān)于蔡翰維簡(jiǎn)述)

每日推薦

誰是中國(guó)最聰明的大模型？MIT科技評(píng)論：訊

轉(zhuǎn)會(huì)1+2：利物浦中場(chǎng)引援關(guān)注6大目標(biāo) 巴薩

淘氣包馬小跳 300字讀后感優(yōu)秀作文

燃！東部戰(zhàn)區(qū)發(fā)布戰(zhàn)訓(xùn)MV《閱海峽》

北交所過會(huì)未拿文企業(yè)8家

官橋鎮(zhèn)：防溺水宣傳不放松

鱷魚的天敵是誰（鱷魚的天敵）

大反攻！消費(fèi)牛了，周黑鴨多賺453%

報(bào)告顯示：廣東數(shù)字經(jīng)濟(jì)發(fā)展指數(shù)位居全國(guó)前

圖片新聞

誰是中國(guó)最聰明的大模型？MIT科技評(píng)論：訊飛星火排

轉(zhuǎn)會(huì)1+2：利物浦中場(chǎng)引援關(guān)注6大目標(biāo) 巴薩天才拒當(dāng)

淘氣包馬小跳 300字讀后感優(yōu)秀作文

燃！東部戰(zhàn)區(qū)發(fā)布戰(zhàn)訓(xùn)MV《閱海峽》

尹恩惠主演的好看的電視?。ㄒ骰菅葸^的電視劇）

48小時(shí)頻道點(diǎn)擊排行

1因油價(jià)上漲，8月18日起杭州市區(qū)出租車

2創(chuàng)新技術(shù)篇：南威云盾隱私計(jì)算，護(hù)航數(shù)

3拼出海底沉睡的歲月——“80后”女文保

4寧德時(shí)代發(fā)布神行超充電池有望推動(dòng)“

5截至7月末私募基金管理規(guī)模達(dá)20.82萬億元

6泉為科技：8月17日召開董事會(huì)會(huì)議

7甘肅通渭：以節(jié)促旅書香濃

8昊海生物科技(06826.HK)中期凈利2.05億

9學(xué)圃齋前古梅兩干蠹傷其一賦此(關(guān)于學(xué)

10車上顯示lkas是什么意思（汽車上lkas是

熱圖推薦

北交所過會(huì)未拿文企業(yè)8家

官橋鎮(zhèn)：防溺水宣傳不放松

鱷魚的天敵是誰（鱷魚的天敵）

大反攻！消費(fèi)牛了，周黑鴨多賺453%

報(bào)告顯示：廣東數(shù)字經(jīng)濟(jì)發(fā)展指數(shù)位居全國(guó)前

因油價(jià)上漲，8月18日起杭州市區(qū)出租車將收