COMIC CLASSROOM

AI 技術小教室第 4 / 5 課

Taalas 硬連線推論漫畫小教室:把模型權重做進晶片

十張漫畫從 HBM 搬移瓶頸講到 4-bit 候選表、one-hot 選路、跨維度累加與 HC1 的專用化代價。本課以教室教學模型拆解硬連線推論的工程直覺,並標明官方數字的測試邊界。

13 分鐘

十張圖把硬連線推論拆開來看

大型模型推論時,時間和能量常常花在搬權重,不只花在乘加。GPU 每吐下一個 token,往往又得把參數再抓一次。Taalas 走的是比較硬的路:把特定模型的權重與資料流固化進晶片,少搬、少做重複工作。

這十張漫畫是教學抽象,不是 Taalas 未公開的電路圖。同一條 activation x 碰上大量低位元固定權重時,可以先準備有限組候選乘積,再讓權重代碼選路。圖給直覺;文字對到機制、限制,以及哪些句子不能推論過頭。

先把資料重用看清楚,再回頭看繞線、精度、流片,以及換模型要付的代價。

1. 模型不是載入,而是做進晶片

第 1 張:左格 GPU 從 HBM 搬權重箱子,右格把模型權重固化在專用晶片;底部寫明不是存進去再讀出,而是模型的一部分直接變成電路
圖 1:第 1 格問「模型去哪裡了」;第 2 格對照一般加速器讀 HBM 與 Taalas 把權重畫進晶片;第 3 格把 HBM 卡車打叉,改走片上資料路徑。重點預告:不是存進晶片再讀出,是模型的一部分直接變成電路。

左邊是一疊標著「權重」的 HBM 箱子;右邊 GPU 伺服器每吐一個字,就要把箱子再搬一次。重點不在諷刺 GPU 算得慢,而在 decode 時反覆取權重的成本。權重很大、又一直被重複使用時,搬運本身就會變成瓶頸。

圖的中間把兩條路攤開。一般 AI 加速器:權重放在 HBM,讀取,再送進運算單元。Taalas 硬連線推論:模型權重固化在晶片裡,資料沿著片上路徑走。末格更直白——HBM 卡車被打叉;activation 從一邊進來,推論結果從另一邊出去。漫畫把效益收成三句:少搬權重、模型專用硬體、推論速度來自專用化。

「做進晶片」最容易被讀過頭。它不是拿火燒模型,也不是把普通權重檔存進 ROM、之後仍照舊讀出來算。更準確的講法是:模型結構與固定權重參與了晶片的實體實作,資料路徑因此能為這個模型高度客製化。

Taalas 對外描述的方向叫 total specialization:一顆晶片服務特定模型,儲存與運算緊密合併。官方也說 HC1 這套示範系統不依賴 HBM、先進封裝、3D 堆疊或液冷。[1] 那是廠商對自家系統的描述,不是「所有硬連線推論都不必 HBM」的物理定律。

彈性換效率,就是這裡的取捨。一般加速器保留載入不同模型的自由;Taalas 用模型專用晶片減少權重搬移。若要改動固化的模型結構或基礎權重,通常得重新設計或流片;這不表示所有設定都固定。Taalas 官方仍列可配置 context window 與 LoRA 支援,兩者要和更換整個基礎模型分開看。

2. 權重換了一個角色

第 2 張:三欄比較傳統 MAC 權重是運算元、類比 CIM 權重是電導、Taalas 教學模型權重是選擇控制;下方選擇器依權重碼從候選值集合放行一條路
圖 2:第 2 格是三欄對照;第 3 格畫出選擇器與候選值集合;第 4 格把控制路徑和 activation 資料路徑拆開。權重碼負責選哪一條路,數值仍由 activation 那邊產生。

同樣叫權重,硬體裡的工作可以完全不同。傳統 MAC 裡,x 和 w 都是運算元,乘完再累加。類比 CIM 常把權重映射成元件電導,用電壓與電流做乘加。這套教學模型則把低位元權重當成索引:先有一組候選值,權重碼去挑其中一個。

選擇器那一格把關係畫清楚:activation x 從左邊進來,權重碼當控制,候選值集合在中間,輸出只放行其中一個候選。先別急著說「沒有乘法」——數值仍由 activation 資料路徑產生。選擇器不負責發明答案,它只決定哪一條路能通過。

這是教學抽象,不是 transistor-level 的 HC1 電路圖。Taalas 現行官方說明把第一代寫成自訂 3-bit 基底,Silicon Llama 混合 3-bit 與 6-bit 參數;第二代才採標準 4-bit 浮點格式。[1] 所以本課 unsigned 4-bit、16 格候選表與 one-hot 只是在建立功能直覺,不能拿來宣稱 HC1 的實際參數格式、電晶體數或閘級網表。

順便分清楚:圖上類比 CIM 那一列畫的是電導式乘加;業界還有數位 CIM,權重仍以 bit 存放、乘加邏輯在周邊。別把「CIM」收成單一實作。後文若出現「select-in-memory, compute-in-periphery」,那是本文自己的類比,不是標準產業分類。

在這套模型裡,權重比較像選路開關,而不是自己長出乘積。下一張會說明為什麼 4-bit 會讓候選集合突然變小、而且可以重用。

3. 4-bit 為什麼只剩 16 種候選?

第 3 張:同一個 activation x 對上大量權重;4-bit 只有 0 到 15 共十六個代碼;大量乘法請求被彙整成十六種可重用候選乘積
圖 3:第 1 格是同一個 x 對上整疊權重;第 2 格把 4-bit 展開成 0 到 15;第 3 格把大量乘法請求收成十六格可重用候選。重點不是 x 只有 16 種,是權重代碼只有 16 種。

一個 x,對面卻是 w1 到 wn 一大疊——矩陣裡同一列或同一個輸入維度,常常就是這種形狀。4-bit 拆開之後,b3 b2 b1 b0 只能編出 2⁴ = 16 個代碼,也就是 0 到 15。

真正的轉折在候選彙整:左邊一疊「乘法請求」票(x × w、x × wi、x × wj),右邊收成 16 種候選乘積。標題寫「十五萬次需求,只有 16 種候選」——那是教室用的數量級,用來強調「很多次」,不是 Taalas 某層真實的乘法次數。低位元量化的意義在這裡:權重再多,索引仍然落在這 16 個位置。

容易讀錯的一句是:不是 x 只有 16 種,是權重代碼只有 16 種。同一個 x 的候選乘積因此可以重用;可重用集合的大小由權重位元數決定,不由 activation 的數值範圍決定。

實際模型不一定是 unsigned 0~15。有號格式、縮放係數、分組量化、非均勻碼本,都會改變硬體要準備的候選與精度損失。這裡先用最乾淨的 16 格建立直覺;產品數字不能直接從這張表抄出去。

4-bit 真正拆開的是兩件事:「要乘多少次」和「要準備幾種答案」。次數可以很大;答案種類卻被位元數鎖住。

4. 先建候選表,再讓權重查表

第 4 張:以 x、2x、4x、8x 四個基礎站,經加法器組合成 0x 到 15x 的十六格查找表;換 x 就重建一次,格數仍是 16
圖 4:第 1 格先建 x、2x、4x、8x;第 2 格用加法器組出 16 格表;第 3 格提醒位移不需通用乘法器,仍有繞線、負載與面積;第 4 格:換 x 重建,表格仍然只有 16 格。

先做出四個基礎值:x、2x、4x、8x。二進位左移一格就是乘 2,不必為這三個倍數各放一顆通用乘法器。再用加法器組合成 0x 到 15x——例如 6x = 4x + 2x,15x = 8x + 4x + 2x + x。表一旦建好,後面那些固定權重就來查同一張表。

「位移免費」這種簡稱會誤導人。位移確實不需要通用乘法器,可是線還是要拉、負載還是在、面積與時序一樣要付。真正省下的是「不要為每一個權重各做一次完整乘法」;不是晶片上憑空多出一張不佔資源的表。

換一個 x,表裡每一格都要重建;格數卻仍由權重代碼數決定,所以還是 16 格。表的寬度跟模型有多大無關,跟權重位元數有關;表的內容則跟著當下這個 activation 走。真正晶片也不一定擺一張肉眼可見的 16 格 ROM——合成後可能是多工器、邏輯閘、或其他等效資料路徑。圖畫的是功能關係,不是 floorplan。

成本沒有消失,只是搬家:從「每個權重各乘一次」,挪到「建表 + 選路 + 把候選值送到許多選擇器」。下一張看權重代碼怎麼指出「我要第幾格」。

5. one-hot:一次只打開一條路

第 5 張:4-bit 權重 0110 經 4-to-16 decoder,只有 sel[6] 為 1;選擇器陣列放行 6x,其餘路徑關斷
圖 5:第 1 格把 0110 解成 sel[6]=1;第 2 格用導通/關斷的開關陣列只放行 6x;第 3 格把控制與資料拆開;第 4 格註明直接 one-hot 是教學示意,實作拓樸可能不同。

以 0110 為例:十進位是 6,進 4-to-16 decoder 之後,16 條 one-hot 線裡只有 sel[6] 為 1,其餘為 0。one-hot 的意思很字面——一次只熱一條。

16 組 activation 候選值送進選擇器;漫畫畫成開關陣列,通過是導通、未通過是關斷。只有 6x 那一條被放行。這些開關本身不攜帶乘積數值;數值已經在候選線上。權重碼負責控制,activation 的候選值才是被放行的資料。

直接 one-hot 最好畫懂,實作卻可能改用樹狀多工器或其他編碼,來減輕佈線與 fan-out。圖上的電晶體顆數,不能直接當成 HC1 的 gate count。位元數往上加,直接 one-hot 的路數按 2ⁿ 成長:3-bit 8 路、4-bit 16 路、8-bit 256 路——第 9 張會回頭算這筆代價。Decoder 本身也有邏輯閘與繞線,不是「一顆電晶體通或不通」就能概括整個選路成本。

權重負責開門;數字還是從 activation 那邊走過來。別把開關當成乘法器。下一張用 x = 3 把表算出來對一下。

6. x = 3,查表一次看懂

第 6 張:x 等於 3 時先建 0、3、6、9、12、18、24 的表;珍珠、奶茶、咖啡三個權重分別指向 6、8、2,查出 18、24、6
圖 6:第 1 格先為 x=3 建表;第 2 格用珍珠 w=6、奶茶 w=8、咖啡 w=2 當三個權重例子;第 3 格驗算 3×6=18、3×8=24、3×2=6。這頁的飲料還只是權重標籤,下一張才變成要比較的輸出候選。

x = 3 時,0x, 1x, 2x, 3x, 4x, 6x, 8x 就是 0、3、6、9、12、18、24。位移那幾個特別好認:2x=6、4x=12、8x=24。表建一次,後面就反覆查。

珍珠、奶茶、咖啡在這頁是三個不同的權重,不是三種飲料維度:w = 6 (0110)、w = 8 (1000)、w = 2 (0010)。各指向表上的一格之後,得到 18、24、6。數學沒變——3×6=18、3×8=24、3×2=6;變的是「乘積被先算好,權重只負責選」。

圖上的黃色警告值得一起讀:此頁用 unsigned 4-bit 只作教學,範圍 0~15,沒有負數。真實矩陣乘法還要處理有號值、縮放、飽和、累加位寬,以及不同層的數值範圍。小例子證明查表能重現乘積,不是證明整個 LLM 只靠一張 16 格表就能跑完。

下一張會把同一個記憶鉤子轉個方向:珍珠、奶茶、咖啡變成輸出端的候選,輸入端則換成「奶茶/甜甜/QQ」三個維度。比喻會換角色,數字關係不會。表建一次就夠;每個權重只負責選答案。

7. 每個維度查一次,最後再累加

第 7 張:輸入三個維度 x1=3、x2=2、x3=4,珍珠、奶茶、咖啡三個候選分別累加得 64、44、8,分數最高是珍珠
圖 7:第 1 格把句子拆成奶茶/甜甜/QQ 三個輸入維度;第 2 格每個維度查一次表;第 3 格把分數加總,珍珠 64、奶茶 44、咖啡 8。這是記憶鉤子,不是 tokenizer 真的這樣切詞。

矩陣向量乘法不是查一次就結束。把一句話想成一杯珍奶時,每個輸入維度像不同配料:x1 = 3(奶茶)、x2 = 2(甜甜)、x3 = 4(QQ)。圖上有註:這只是比喻,不是實際 tokenizer 行為——語言模型不會把「甜甜」「QQ」做成三個固定人工維度。

每個 x 建一張表,再對珍珠、奶茶、咖啡三個候選查權重、打分數:

  • 珍珠:3×6=18,2×5=10,4×9=36
  • 奶茶:3×8=24,2×8=16,4×1=4
  • 咖啡:3×2=6,2×1=2,4×0=0

加總之後:珍珠 18+10+36=64,奶茶 24+16+4=44,咖啡 6+2+0=8。分數最高的是珍珠。重點不是珍奶店選品,而是輸出通道要等所有輸入維度的貢獻到齊,才能比較。

角色可以這樣記:x 決定這個維度有多重要;w 決定某個候選在這個維度拿幾分;最後才在候選之間比較。代價寫在圖上:要查 N 次表,再把分數加總。硬體上這些維度通常平行處理;漫畫用序列是為了讓每一筆分數從哪來跟得上。共享一個 x、查出貢獻、累加,再換下一個 x——流程就這樣轉。

8. 算法沒變,重用方式變了

第 8 張:左邊一般乘法器對每個權重各自產生部分積;右邊先為同一個 x 建 0x 到 15x 共享表再送到固定選擇器;底部用匯率與十六種面額比喻
圖 8:第 1 格是每個權重各自做 x、2x、4x、8x;第 2 格改成同一張候選表服務許多固定選擇器;第 3 格把 x 比成今日匯率、把低位元 w 比成十六種面額。匯率換了要重做表,面額種類仍是 16 種。

對照上一張的累加之後,回頭看一般乘法器會更清楚。4-bit 權重的每一個 bit 決定要不要加 8x、4x、2x、x,再加總——本來就是移位與部分積。麻煩在於:每個權重都各自做一次。權重一多,同樣的 x、2x、4x、8x 就被重做很多遍。

共享表那一側把重複工作抽到中間:先為當前的 x 建 0x~15x,再送到一排固定選擇器。同一個 x,候選結果重用。加總還是要做,只是部分積不再由每個權重各自重建。

匯率櫃檯只是記憶鉤子。今日匯率 1 USD = x TWD 對應當前的 x;標準面額 0 到 15 對應低位元 w;櫃檯前的人對應很多固定權重。匯率換了,表要重做;面額種類仍然只有 16 種。別把它讀成外匯硬體或 tokenizer。

這套教室模型並沒有發明新的數學;它把重複工作搬出來,只做一次。效益來自大量權重共享同一個 x。共享不夠、activation 型別太窄、量化碼本太複雜,或繞線與時序把資料路徑拖住,查表優勢就會縮水。2026 年一篇針對 1.58-bit LLM LUT 加速器的研究也指出,最佳架構高度受 activation 資料型別影響;對小整數型別,LUT 重用的收益會變小。[4] 那篇是相關設計空間證據,不是 HC1 實作說明。

結果仍是 x × w。變的是哪些中間值值得抽出來共用,哪些還是每個權重自己做比較划算。下一張把這條路的帳單攤開。

9. 專用化很快,也有代價

第 9 張:直接 one-hot 從 3-bit 八路、4-bit 十六路到 8-bit 兩百五十六路;三把鎖是低位元量化、大量共享同一個 x、權重固定;天平兩端是少搬資料與換模型要重新流片
圖 9:第 1 格看路數隨位元數指數增加;第 2 格三個條件;第 3 格天平左邊少搬資料、右邊換模型要重新設計或流片。高效率與低彈性是同一件事的兩面。

第 5 張埋下的數字在這裡攤開。直接 one-hot:3-bit 8 路、4-bit 16 路、8-bit 256 路。位元數往上加,選擇線不是線性增加。圖上有註:實際拓樸可能不同。這是教學模型的壓力測試,不是在宣布 8-bit 一定比乘法器貴——那要看 decoder、繞線壅塞與乘法器面積怎麼比,漫畫沒給估算表。

三把鎖可以並排看。低位元量化:位元數夠低,路數才壓得住。大量共享同一個 x:建表成本才能攤到很多權重上。權重固定:權重真的做進晶片,資料路徑才能為這個模型客製到很深。少一把鎖,這套故事就沒那麼順。

天平左邊是少搬資料、重用候選結果,硬連線換高速與節能;右邊是換模型要重新設計或流片,開發成本高、彈性較低。位移仍有繞線與負載;精度與彈性要取捨;固定模型才值得高度專用化——這些都不是「免費午餐」的附帶說明,而是同一選擇的另一面。

工程師延伸:真正要收斂的是 PPA 與可更新性

架構評估不能只數乘法器。候選生成、decoder、選擇網路、fan-out、buffer、累加器、clock tree、placement、routing congestion、timing closure 與測試性都會進 PPA。權重若固定在光罩或實體邏輯裡,產品還要回答模型版本、錯誤修補、安全更新與供應生命週期。

因此,硬連線推論比較適合需求穩定、出貨量能攤提 NRE、且模型更換週期可預測的場景。若模型每天變、客戶需要任意 fine-tuning,或同一台機器必須承載大量模型,通用 GPU 與可程式化加速器仍有很強的系統價值。

下一張用 HC1 的官方數字,練習怎麼讀、而不是怎麼背。

10. HC1:把專用化推到極致之後,數字怎麼讀?

第 10 張:HC1 技術驗證晶片列 Llama 3.1 8B、TSMC 6nm、815 平方毫米、530 億電晶體;伺服器 2.5 kW;約 17K tokens 每秒每使用者並標示特定測試條件;底部五步驟回顧與 select-in-memory 類比
圖 10:第 1、2 格的規格與 17K tokens/s/user 都來自 Taalas 官方資料,並標了「特定測試條件;非獨立基準」。第 3 格用五步驟把前九張串起來。第 4 格的 select-in-memory, compute-in-periphery 是本文類比,不是產業標準名稱。

HC1 技術驗證晶片的公開規格可以並排放:Llama 3.1 8B、TSMC 6nm、815 mm²、53B transistors;伺服器功耗 2.5 kW;約 17K tokens/s/user。圖上那枚警告要連同數字一起讀:特定測試條件,不是獨立基準。[2]

產品頁把 HC1 定位成 technology demonstrator。17K 的測試條件是 1K input/1K output。競品數字的來源與量測方式並不完全相同,所以不宜把「快幾倍」寫成跨平台常數。單卡功耗、十卡整機、batch、單使用者延遲與吞吐量,官方頁面上也要分開看,不能混成一個速度。

圖上的五步驟把前面串起來:權重固化 → 4-bit 只有 16 種代碼 → 先建候選表 → 權重選路 → 跨維度累加。收束點不是魔法,而是設計立場——不是把乘法變不見,而是用模型專用化,換掉大量重複搬移與重複運算。漫畫自己寫了本文類比:select-in-memory, compute-in-periphery,並註明這不是產業標準名稱。權重比較像在記憶位置上負責選;數值仍在周邊資料路徑上產生。

這條路能不能擴大到更多模型,還要看晶片重製速度、良率、成本、模型更新節奏,以及真實服務負載下的獨立測試。官方數字可以當起點,不能當結論。

課末五句

  1. Taalas 把特定模型的權重與資料流高度固化,核心取捨是效率對彈性:少搬權重,換模型通常要重新設計或流片。
  2. 4-bit 權重只有 16 個代碼,讓同一個 activation 的候選乘積有機會被大量重用;漫畫上的「十五萬次」是在說很多次,不是產品規格。
  3. one-hot 與 16 格表是教室模型,用來分開「控制」和「資料」。它不是公開的 HC1 電路圖。
  4. 位移不用通用乘法器,仍然要付繞線、負載、面積、時序與累加成本。「免費」是簡稱,容易誤導。
  5. 17K tokens/s/user、815 mm²、53B transistors、2.5 kW 都屬 Taalas 官方測試與規格;判讀時必須連同模型、序列長度、功耗與測試來源一起看。

若還想往下問,有兩條路。一條看模型固化後,LoRA、KV cache 與版本更新還能留多少空間。另一條回到 IC 設計,估算 lookup、selector、routing 與 accumulator 的 PPA。不必兩條一起走;記住圖是直覺,數字有邊界,專用化不是免費午餐。

References

  1. Taalas, The path to ubiquitous AI:Taalas 對 total specialization、儲存與運算合併,以及 HC1 系統定位的官方說明。
  2. Taalas, HC1 Technology Demonstrator:HC1 模型、製程、晶片面積、電晶體數、伺服器功耗與官方效能測試條件。
  3. EE Times, Taalas Specializes to Extremes for Extraordinary Token Speed:Taalas 創辦人對 4-bit 參數、單電晶體乘法相關工作與全數位運算的公開說明。
  4. Geens et al., Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference:LUT 型低位元 LLM 加速器的設計空間與 activation 型別取捨。

Hashtags: #Taalas #HC1 #硬連線推論 #AI推論 #AI晶片 #ASIC #HBM #MemoryWall #四位元量化 #OneHot #半導體 #漫畫小教室

互動練習:16 格候選表與固定選路

三個 activation 分別建立 0x–15x 候選表,兩個輸出用固定權重選路後累加。修改想要的第一個權重,觀察舊選路是否還算對;再重新編譯選路比較。

這是 unsigned 4-bit 碼、整數精確算術的功能模型,不是 HC1 電晶體實作、RTL 時序或量化 LLM。沒有 overflow、縮放係數、佈線成本與 fan-out 模擬。「重新編譯」只改本頁陣列;真實固定模型的變動可能需要重新設計與流片,產品保留的可配置部分則另論。

本次實驗條件

學習指南

AI 技術小教室

0 / 5

先備知識

  • 基本矩陣向量乘法與低位元量化概念

我學會了什麼

  • 說明固定低位元權重為何能重用候選乘積
  • 能沿著漫畫把 4-bit 權重從建表、one-hot 選路講到跨維度累加
  • 能帶著測試邊界讀 HC1 官方數字,而且不把漫畫當成晶片電路圖

本課術語

查看術語字典 →

延伸閱讀

課後小測驗

1. 教學模型中,4-bit 權重代碼提供什麼?
2. 把 x 位移成 2x、4x、8x 是否完全沒有成本?
3. 硬連線推論為何可能更有效率?
4. 17K tokens/s/user 應該怎麼解讀?
5. 把單一模型固定在晶片裡,主要產品風險是什麼?

讀到這裡,辛苦了。

把概念帶走,比把術語背走更重要。

#Taalas#硬連線推論#Hardwired Inference#HC1#AI 推論#AI 加速器#ASIC#HBM#Memory Wall#4-bit 量化#One-hot#Lookup Table#Llama 3.1 8B#模型專用化#半導體#漫畫小教室