
DeepSeek架構比較圖
A dense side-by-side technical infographic comparing DeepSeek V3/R1 and DeepSeek V4 transformer architectures, suitable for social media posts, presentations, or model analysis visuals.
觀看1,600
按讚25
留言0
分享2
書籤5
引用0
翻譯
{"type":"並排 AI 架構比較資訊圖表","style":"乾淨的技術圖表,白色背景,細黑色輪廓,圓角矩形,虛線註釋框,顏色編碼高亮,簡報投影片美學,向量資訊圖表","canvas":{"aspect_ratio":"2:1","resolution":"寬橫式"},"title_row":{"left_title":"DeepSeek V3/R1(6710 億)","right_title":"DeepSeek V4(1.2 兆)","left_title_color":"明亮橙紅色","right_title_color":"明亮藍色"},"layout":{"columns":2,"sections":[{"title":"DeepSeek V3/R1(6710 億)","position":"左半部分","count":9,"labels":["詞彙大小 129k","FeedForward(SwiGLU)模組","中間隱藏層維度 2,048","MoE 層","支援上下文長度 128k tokens","前 3 個區塊使用隱藏大小 18,432 的密集 FFN 而非 MoE","範例輸入文本","嵌入維度 7,168","128 個注意力頭"]},{"title":"DeepSeek V4(1.2 兆)","position":"右半部分","count":9,"labels":["詞彙大小 160k","FeedForward(SwiGLU)模組","中間隱藏層維度 3,072","MoE 層","支援上下文長度 256k tokens","前 3 個區塊使用隱藏大小 24,576 的密集 FFN 而非 MoE","範例輸入文本","嵌入維度 8,192","128 個注意力頭"]},{"title":"底部比較表","position":"底部全寬","count":10,"labels":["總參數","每個 token 的活躍參數","隱藏大小","Esmple dimesiegn","DeepSeek V3/R1","中間(FF)","注意力頭","上下文長度","嵌入維度","詞彙大小"]}]},"left_panel":{"background":"非常淺灰色圓角矩形","main_stack":{"count":8,"blocks":["Tokenized text","Token embedding 層","RMSNorm 1","Multi-head Latent Attention","RMSNorm 2","MoE","最終 RMSNorm","線性輸出層"]},"side_module":"RoPE 附著在左側的注意力區塊上","attention_block":{"label":"Multi-head Latent Attention","accent":"Latent 一詞使用橙紅色文字"},"feedforward_inset":{"title":"FeedForward(SwiGLU)模組","count":4,"blocks":["線性層","SiLU 激活","線性層","線性層"],"diagram":"兩個分支相乘,然後投影"},"moe_inset":{"title":"MoE 層","count":5,"blocks":["頂部合併節點","Feed forward","Feed forward","Router","專家數量徽章 256"],"details":"小黑色方塊,1 個選中的專家,箭頭向上路由到專家,虛線分隔符"},"annotations":{"vocab":"詞彙大小 129k","ff_dim":"中間隱藏層維度 2,048","context":"支援上下文長度 128k tokens","dense_first_blocks":"前 3 個區塊使用隱藏大小 18,432 的密集 FFN 而非 MoE","resource_savings":"資源節省:模型大小為 671B,但每個 token 僅有 1(共享)+ 8 個專家活躍;每個推論步驟僅有 37B 參數活躍"},"bottom_stats":{"count":10,"items":["總參數:671B","每個 token 的活躍參數:37B(1 + 8 個專家)","隱藏大小:7,128","Esmple dimesiegn:28,432","中間(FF):2,048","注意力頭:128","上下文長度:128k","嵌入維度:前 3 個區塊","Context ler length:22G7","詞彙大小:129k"]}},"right_panel":{"background":"非常淺藍色圓角矩形","main_stack":{"count":8,"blocks":["Tokenized text","Token embedding 層","RMSNorm 1","Multi-head Latent Attention","RMSNorm 2","MoE","最終 RMSNorm","線性輸出層"]},"side_module":"RoPE 附著在左側的注意力區塊上","attention_block":{"label":"Multi-head Latent Attention","accent":"Latent 一詞使用藍色文字"},"feedforward_inset":{"title":"FeedForward(SwiGLU)模組","count":4,"blocks":["線性層","SiLU 激活","線性層","線性層"],"diagram":"與左側面板相同的結構"},"moe_inset":{"title":"MoE 層","count":5,"blocks":["頂部合併節點","Feed forward","Feed forward","Router","專家數量徽章 384"],"details":"小黑色方塊,1 個選中的專家,箭頭向上路由到專家,虛線分隔符,藍色邊框強調"},"annotations":{"vocab":"詞彙大小 160k","ff_dim":"中間隱藏層維度 3,072","context":"支援上下文長度 256k tokens","dense_first_blocks":"前 3 個區塊使用隱藏大小 24,576 的密集 FFN 而非 MoE","resource_savings":"資源節省:模型大小為 1.2T,但每個 token 僅有 1(共享)+ 8 個專家活躍;每個推論步驟僅有 52B 參數活躍"},"bottom_stats":{"count":10,"items":["總參數:1.2T","每個 token 的活躍參數:52B(1 + 8 個專家)","隱藏大小:7,2B","Esmple dimesiegn:28,432","中間(FF):3,072","注意力頭:128","上下文長度:256k","嵌入維度:前 3 個區塊","Context ler length:22G7","詞彙大小:160k"]}},"global_notes":"創建一個高度詳細的 Transformer 架構比較圖表,具有鏡像佈局。每個半邊包含一個大型模型堆疊圖表和 2 個插圖:1 個前饋模組和 1 個 MoE 層。使用區塊之間的箭頭、微小的技術標籤和從標籤到相關組件的連接線。保持排版密集且類似簡報投影片,使用橙紅色表示所有 V3/R1 強調,藍色表示所有 V4 強調。包括一行底部的小型緊湊表格指標,跨越寬度。保留略顯不完美、人工製造的資訊圖表外觀,具有非常小的文字和擁擠的註釋。"}
機器翻譯 — 實際產出作品的是原文 prompt。

















