簡單來說, DeepSeek-V3只會在需要時啟動部分「腦細胞」而不是全部,這樣就大大降低了運算資源的消耗,這個模型僅需啟動370億參數進行推理,而非動用完整模型的6710億參數,從而降低了即時運算的資源消耗。對照 Chat GPT-4是1750億個參數強大語言模型,就可明白 DeepSeek-V3所需的算力的確少很多,更明顯的對照是 OpenAI o1每個月收費200美元, DeepSeek免費使用,難怪連微軟、亞馬遜與輝達都採用。
》本文限會員登入瀏覽,請先登入
登入會員


