天天報道:GPT-4參數(shù)最新爆料!1.76萬億參數(shù),8個2200億MoE模型,PyTorch創(chuàng)始人深信不疑
2023-06-21 20:38:32 來源:清一色財經(jīng)
GPT-4遠(yuǎn)不止1萬億,甚至,還是8個2200億參數(shù)組成的混合專家模型。
家人們,GPT-4的參數(shù)可能還真不止1萬億!
近來,美國知名駭客George Hotz在接受采訪時透露,GPT-4由8個220B模型組成。
(資料圖片)
這么算來,8 x 220B = 1.76萬億。
就連PyTorch的創(chuàng)建者Soumith Chintala對此也深信不疑。
GPT-4:8 x 220B專家模型用不同的數(shù)據(jù)/任務(wù)分布和16-iter推理進(jìn)行訓(xùn)練。
如果真是這樣的話,GPT-4的訓(xùn)練可能更加有效。
1.76萬億「八頭蛇」?
在GPT-4還未放出之前,GPT-3有1750億個參數(shù),一眾網(wǎng)友猜測GPT-4豈不是要逆天,最起碼1萬億。
而George在接受Latent Space的采訪時,對GPT4架構(gòu)的描述著實讓人震驚。
他的部分原話如下:
GPT-4每個head都有2200億參數(shù),是一個8路的混合模型。所以,混合模型是當(dāng)你想不出辦法的時候才會做的。OpenAI訓(xùn)練了相同模型8次,他們有一些小技巧。他們實際上進(jìn)行了16次推斷。
他特別強(qiáng)調(diào),OpenAI做了8個混合專家模型,任何人可以花8倍資金都能訓(xùn)練出來。
也就是說,人們能夠訓(xùn)練更小模型更長時間,微調(diào)后,就能找到這些技巧。
OpenAI曾經(jīng)發(fā)表類似關(guān)于讓計算量不變的情況下,讓訓(xùn)練更好的算法,比較像BatchNorm和NoBatchNorm。
網(wǎng)友熱評
就像George所說,這是8個較小的模型,如果有足夠資金訓(xùn)練8個混合模型,這是一個微不足道的解決方案。
所以,GPT-4是GPT-3的10倍,而1月份的所有小圈圈大圈圈的meme實際上是……真的?!
網(wǎng)友得知秘訣后,打算自己也要訓(xùn)練一個LLaMA集合體與GPT-4競爭。
還有網(wǎng)友稱,這有點像LLM-Blender。
我早就聽到了稍微可信的傳言,說GPT-4將是MoE,但從未得到證實。MoE和大約1萬億個參數(shù)不會讓我感到驚訝,這聽起來極為合理。
還有網(wǎng)友進(jìn)行深度分析:
老實說,我預(yù)計這將是人工智能架構(gòu)的下一階段。我們已經(jīng)看到特定任務(wù)模型在任務(wù)中的表現(xiàn)比一般模型好得多。
因此,將許多特定任務(wù)模型組合在一起將是下一個合乎邏輯的步驟。這幾乎使升級系統(tǒng)變得容易得多,一次只能處理一個模型。
話雖如此,OpenAI以一種未來可能會,也可能不會的方式做到了這一點。顯然,組合系統(tǒng)可能會有更多的小模型,而不是幾個更大的模型。
如果這是真的,這是否意味著每個220B模型也有32K的上下文長度?
網(wǎng)友下了功夫,給它命名為「九頭蛇」。
關(guān)鍵詞:
相關(guān)閱讀
- (2023-06-21)天天報道:GPT-4參數(shù)最新爆料!1.76萬億參數(shù),8個2200億MoE模型,PyTorch創(chuàng)始人深信不疑
- (2023-06-21)實時焦點:智能自動化的興起:數(shù)字時代的人工智能、機(jī)器人和制造業(yè)
- (2023-06-21)松原警方開辟“綠色通道”為1500輛共享電動自行車集中“辦證”_當(dāng)前獨家
- (2023-06-21)A股收評:滬指跌1.31%失守3200點 復(fù)合集流體概念股逆勢大漲
- (2023-06-21)觀熱點:2023年廣東養(yǎng)老金調(diào)整細(xì)則將公布最新消息,平均工資出爐,退休人員養(yǎng)老金重算
- (2023-06-21)安陽擔(dān)保追償糾紛律師費用一般怎么計算
- (2023-06-21)外交部領(lǐng)事司司長:持續(xù)優(yōu)化調(diào)整中外人員往來政策
- (2023-06-21)疑似喂食幼童不明藥品事件在臺延燒 藍(lán)綠就“烏龍大案”展開角力 天天視點
- (2023-06-21)領(lǐng)失業(yè)金對之后的工作有影響嗎 領(lǐng)取失業(yè)保險金對繳納養(yǎng)老保險費有影響嗎?
- (2023-06-21)超過60天還能申領(lǐng)失業(yè)保險嗎 失業(yè)保險金只能領(lǐng)一次嗎?
- (2023-06-21)端午、暑期、汛期出游安全提示發(fā)布,注意5方面_當(dāng)前信息
- (2023-06-21)移動云OpenCOCA開源項目重磅首發(fā),助力打造國家級自主可控基礎(chǔ)設(shè)施|天天播資訊
- (2023-06-21)深圳失業(yè)補(bǔ)助金還能申請嗎?深圳失業(yè)保險金和失業(yè)補(bǔ)助金的區(qū)別 世界熱議
- (2023-06-21)知名品牌又關(guān)一店?“骨折價”清倉:夏裝20元起 戒指一塊多一個
- (2023-06-21)6月21日炬光科技跌5.75%,新華增怡債券A基金重倉該股
- (2023-06-21)動態(tài)焦點:云意電氣(300304)6月21日主力資金凈買入1136.45萬元
- (2023-06-21)工信部:深化“5G+工業(yè)互聯(lián)網(wǎng)”發(fā)展 推動不少于3000家企業(yè)建設(shè)5G工廠
- (2023-06-21)呂梁:關(guān)于市直機(jī)關(guān)公積金繳存人購房辦理貸款的政策指導(dǎo)
- (2023-06-21)爸爸去哪兒了票房_爸爸去哪兒 票房_天天觀熱點
- (2023-06-21)【“亮成績、展形象,二十大精神在支部”一線巡禮】青海大通田家溝:走出一條紅色引領(lǐng)、綠色發(fā)展的新路子
- (2023-06-21)農(nóng)發(fā)行衛(wèi)輝市支行:開展金融知識宣傳活動
- (2023-06-21)速訊:名利圈的潛規(guī)則,趙子琪都吃過虧,秦嵐還在原地打轉(zhuǎn)?
- (2023-06-21)這個村獲評2022年度湖北省鄉(xiāng)村振興示范村
- (2023-06-21)vivo V29或在未來幾周亮相 搭載驍龍778G+移動平臺
- (2023-06-21)618復(fù)盤 | 文化消費明顯增長,Z世代從天貓轉(zhuǎn)向抖音拼多多
- (2023-06-21)注意!這18批次兒童家具抽查不合格!涉iloom、可比熊等 當(dāng)前資訊
- (2023-06-21)RTOS任務(wù)進(jìn)行單元測試的4種策略
- (2023-06-21)今日熱聞!杭州一男子出門買早飯,在綠化帶內(nèi)迷路四天三夜,吃野花喝露水求生
- (2023-06-21)全球觀天下!美麗山鄉(xiāng)傳統(tǒng)民俗迎端午
- (2023-06-21)熱資訊!OpenAI放大!將推出史上最強(qiáng)「模型商店」,打通所有ChatGPT應(yīng)用