天天報(bào)道:GPT-4參數(shù)最新爆料！1.76萬億參數(shù)，8個(gè)2200億MoE模型，PyTorch創(chuàng)始人深信不疑

2023-06-21 20:38:32 來源：清一色財(cái)經(jīng)

在GPT-4還未放出之前，GPT-3有1750億個(gè)參數(shù)，一眾網(wǎng)友猜測GPT-4豈不是要逆天，最起碼1萬億。

而George在接受Latent Space的采訪時(shí)，對GPT4架構(gòu)的描述著實(shí)讓人震驚。

他的部分原話如下：

GPT-4每個(gè)head都有2200億參數(shù)，是一個(gè)8路的混合模型。所以，混合模型是當(dāng)你想不出辦法的時(shí)候才會做的。OpenAI訓(xùn)練了相同模型8次，他們有一些小技巧。他們實(shí)際上進(jìn)行了16次推斷。

他特別強(qiáng)調(diào)，OpenAI做了8個(gè)混合專家模型，任何人可以花8倍資金都能訓(xùn)練出來。

也就是說，人們能夠訓(xùn)練更小模型更長時(shí)間，微調(diào)后，就能找到這些技巧。

OpenAI曾經(jīng)發(fā)表類似關(guān)于讓計(jì)算量不變的情況下，讓訓(xùn)練更好的算法，比較像BatchNorm和NoBatchNorm。

就像George所說，這是8個(gè)較小的模型，如果有足夠資金訓(xùn)練8個(gè)混合模型，這是一個(gè)微不足道的解決方案。

所以，GPT-4是GPT-3的10倍，而1月份的所有小圈圈大圈圈的meme實(shí)際上是……真的？！

網(wǎng)友得知秘訣后，打算自己也要訓(xùn)練一個(gè)LLaMA集合體與GPT-4競爭。

還有網(wǎng)友稱，這有點(diǎn)像LLM-Blender。

我早就聽到了稍微可信的傳言，說GPT-4將是MoE，但從未得到證實(shí)。MoE和大約1萬億個(gè)參數(shù)不會讓我感到驚訝，這聽起來極為合理。

還有網(wǎng)友進(jìn)行深度分析：

老實(shí)說，我預(yù)計(jì)這將是人工智能架構(gòu)的下一階段。我們已經(jīng)看到特定任務(wù)模型在任務(wù)中的表現(xiàn)比一般模型好得多。

因此，將許多特定任務(wù)模型組合在一起將是下一個(gè)合乎邏輯的步驟。這幾乎使升級系統(tǒng)變得容易得多，一次只能處理一個(gè)模型。

話雖如此，OpenAI以一種未來可能會，也可能不會的方式做到了這一點(diǎn)。顯然，組合系統(tǒng)可能會有更多的小模型，而不是幾個(gè)更大的模型。

如果這是真的，這是否意味著每個(gè)220B模型也有32K的上下文長度？

網(wǎng)友下了功夫，給它命名為「九頭蛇」。

關(guān)鍵詞：

[責(zé)任編輯：]

欧美日韩电影精品视频_亚洲天堂一区二区三区四区_亚洲欧美日韩国产综合_日韩精品一区二区三区中文_為您提供優質色综合久久88色综合天天