誰是中國最聰明的大模型?MIT科技評論:訊飛星火排名第一
2023-08-18 09:09:30 來源:大皖新聞
大皖新聞訊誰是中國最聰明的認知大模型?8月17日,《麻省理工科技評論》中國最新發(fā)布的大模型評測報告給出了答案。 報告顯示,在8個一級大類的600道題目的測試和盲評中,訊飛星火認知大模型V2.0在6個大類中得分率排名第一,在此次評測中表現(xiàn)突出,以 81.5 分(百分制計)的成績在本次評測中登頂,榮獲“最聰明”的國產(chǎn)大模型稱號。
大模型評測綜合得分率
《麻省理工科技評論》中國從研發(fā)和商業(yè)化能力、外界態(tài)度以及發(fā)展趨勢等維度全方位檢測大模型的能力,力圖評出“最聰明”的國產(chǎn)大模型。選取了“訊飛星火”、“百度文心一言”、“商湯商量”、“阿里通義千問”作為中文大模型平臺的代表,展開系統(tǒng)、科學(xué)的評測。
【資料圖】
4個大模型各項能力雷達圖
本次評測使用的測試集包含600道題目,覆蓋了語言專項、數(shù)學(xué)專項、理科綜合、文科綜合、邏輯思維、編程能力、綜合知識、安全性共 8 個一級大類,126 個二級分類,290 個三級標簽,并針對問題的豐富性和多樣性做了優(yōu)化。
在題目類型上,為了兼顧定量、定性的評價與測試,設(shè)置了“單選”、“多選”、“填空”、“簡答”4個題型,分別有 145 道、138 道、136 道和 181 道。大模型評測體系使用盲評方式,客觀評估國產(chǎn)大模型的聰明程度。
作為“最聰明”的大模型的基礎(chǔ)能力,語言專項評測包含對話理解、多語種、諷刺、古詩詞理解、文本生成、要點總結(jié)、情感分析、語義判斷等 61 個二級分類,題型則以簡答為主。結(jié)果顯示,訊飛星火 85.73%的得分率排名第一,明顯高于平均值。
數(shù)學(xué)專項評測,是“最聰明”大模型必不可少的評測維度。本次評測包含代數(shù)、幾何、解方程、復(fù)雜數(shù)學(xué)、統(tǒng)計學(xué)等 9 個二級分類,以選擇題為主。
其中,訊飛星火以 77.75% 的得分率名列第一,遠高于平均得分率 56%,其他平臺得分率基本相當。報告稱,在大模型普遍“數(shù)學(xué)不好”的情況下,訊飛星火這一成績頗為難得,其在數(shù)學(xué)專項上的領(lǐng)先同樣體現(xiàn)在二級分類的評分結(jié)果上,在 77.8%的二級分類中得分率第一,遠超其他平臺,初步判斷其擅長幾何與情景應(yīng)用。
作為體現(xiàn)大模型“聰明程度”不可或缺的“硬核”部分,理科綜合評測包含表格問答、化學(xué)、生物、物理、醫(yī)學(xué) 5 個二級分類,題型上以單選和簡答為主。
評測結(jié)果中,訊飛星火 78.50% 的得分率排名第一。另外,訊飛星火在理科綜合大類下 80% 的二級分類評測中得分率為第一,化學(xué)與生物較為突出。
邏輯思維也是“最聰明”大模型的重要體現(xiàn),本次邏輯思維評測在邏輯推理、思維鏈等方面設(shè)計了較多的題目,包含類比、常識推理、空間方位、演繹推理、邏輯謬誤檢測、因果推理等 19 個二級分類,題型上相對平均,其中填空題最多,多選題最少。
在邏輯思維題目中,訊飛星火 81.25%的得分率名列第一,明顯高于 72.6% 的平均值。此外,訊飛星火在邏輯思維 63.2% 的二級分類問題上得分率第一。
編程能力是大模型比較高階的能力,本次的編程能力評測包含 ASCII、ASCII碼識別、Python、代碼、代碼修正、計算機 6 個二級分類,其中 Python 主要以簡答形式評估大模型的代碼生成能力和正確率,其他則以客觀題的形式考察。
結(jié)果顯示,訊飛星火 80% 的得分率明顯高于 71%的平均值,其他平臺得分率基本相當。值得一提的是,在許多人關(guān)心的生成代碼的簡答題單項上,訊飛星火的得分率高達 82%,遠高于其他平臺。
作為比較難的評測維度,綜合知識對大模型的“聰明”程度要求也很高,涉及的題目較雜,包含百科問答、常識、科學(xué)知識、事實問答、工作技巧、謎語等 13 個二級分類,題型以多選為主。
在綜合知識評測上,訊飛星火 80.61% 的得分率排名第一,在 84.6% 的二級分類上得分率第一。
報告指出,在本輪大模型評測中,訊飛星火以 81.5 分的成績拔得頭籌,成為“最聰明”的國產(chǎn)大模型。
值得注意的是,訊飛星火在編程能力、理科綜合、邏輯思維、數(shù)學(xué)專項、語言專項和綜合知識這 6 個一級大類中得分率排名第一,在此次評測中表現(xiàn)十分全面,尤其是在代碼生成、數(shù)學(xué)能力、理科與邏輯等方面優(yōu)勢明顯,是本次“最聰明的理科生”。
大皖新聞記者 項磊
編輯 陶娜
關(guān)鍵詞:
相關(guān)閱讀
- (2023-08-18)誰是中國最聰明的大模型?MIT科技評論:訊飛星火排名第一
- (2023-08-18)轉(zhuǎn)會1+2:利物浦中場引援關(guān)注6大目標 巴薩天才拒當替補將轉(zhuǎn)會
- (2023-08-18)淘氣包馬小跳 300字讀后感優(yōu)秀作文
- (2023-08-18)燃!東部戰(zhàn)區(qū)發(fā)布戰(zhàn)訓(xùn)MV《閱海峽》
- (2023-08-18)北交所過會未拿文企業(yè)8家
- (2023-08-18)官橋鎮(zhèn):防溺水宣傳不放松
- (2023-08-18)鱷魚的天敵是誰(鱷魚的天敵)
- (2023-08-18)大反攻!消費牛了,周黑鴨多賺453%
- (2023-08-18)報告顯示:廣東數(shù)字經(jīng)濟發(fā)展指數(shù)位居全國前列
- (2023-08-18)因油價上漲,8月18日起杭州市區(qū)出租車將收取1元燃油附加費
- (2023-08-18)創(chuàng)新技術(shù)篇:南威云盾隱私計算,護航數(shù)據(jù)要素流通安全
- (2023-08-18)拼出海底沉睡的歲月——“80后”女文保工作者的“海撈瓷”故事
- (2023-08-18)寧德時代發(fā)布神行超充電池 有望推動“電器件”迭代換新
- (2023-08-18)截至7月末私募基金管理規(guī)模達20.82萬億元
- (2023-08-18)泉為科技:8月17日召開董事會會議
- (2023-08-18)甘肅通渭:以節(jié)促旅書香濃
- (2023-08-18)昊海生物科技(06826.HK)中期凈利2.05億元 同比增長188.94%
- (2023-08-18)學(xué)圃齋前古梅兩干蠹傷其一賦此(關(guān)于學(xué)圃齋前古梅兩干蠹傷其一賦此簡述)
- (2023-08-18)車上顯示lkas是什么意思(汽車上lkas是什么意思?)
- (2023-08-18)怎么打中間的圓點 中間的圓點
- (2023-08-18)蜘蛛俠暗影之網(wǎng)怎么變黑蜘蛛 蜘蛛俠暗影之網(wǎng)怎么調(diào)中文
- (2023-08-18)贈書簽名范例 贈書
- (2023-08-18)數(shù)據(jù)驚人!53場52球&三冠王,哈蘭德能奪今年金球獎嗎?
- (2023-08-18)2014年九月份瑞鷹車型價格及豪華選擇
- (2023-08-18)河北前十名易經(jīng)大師 出自衡水地域的四位八卦掌名家)
- (2023-08-18)2023天津初中開學(xué)時間(寒假+暑假)
- (2023-08-18)英雄聯(lián)盟1316版本正式服女警加強了什么
- (2023-08-18)董蕓(關(guān)于董蕓簡述)
- (2023-08-18)蔡翰維(關(guān)于蔡翰維簡述)