Elektrine lite

← Feed

@isotopp@infosec.exchange

Post #4061930

2026-07-24 11:47 UTC

Kimi 3 ist ein Modell mit 2.8 Billionen Parametern (deutsche Billion, 2.8e12 Parameter). Es ist ein sparsames MoE-Modell mit 896 Experten. Das heißt, Du brauchst immer noch Speicher, um das ganze Modell zu laden, aber es sind immer nur 16 von den 896 Experten aktiv, also wird nicht der ganze Speicher umgegraben, sondern immer nur 16/896tel davon pro Token. 2.8e12 Parameter in BF16 sind 5.1 TB, als in8 sind es 2.55 TB und als Q4_K_M werden es dann ca. 1.6 TB Speicher sein. Angekündigt ist stattdessen ein MXFP4 mit speziellen Kernes, und einer Zielgröße um die 1.5 TB. Dazu kommen noch Overhead, Kontext und KV-Caches der 23 vollständigen MLA-Layer und ein paar andere Dinge. Genaues werden wir erst am 27. Juli lernen, wenn die Weights raus sind. 16x H200 (141 GB) sind 2.256 TB VRAM, bleiben gut 500 GB nach den Weights. 16x B200 (192GB) geben 3 B VRAM, also 1.3 TB Reserve nach dem Laden vom Q4-Modell. Das reicht sicher für Kontext und KV-Caches. Für den Betrieb daheim würde man eine Destillation mit 50b-100b (Milliarden, 1e9) Parametern erwarten mit 3B bis 10B aktiven Parametern. Ein 70b-a3b auf 128 GB würde als Q6_K dann etwa 60 GB Weights bringen, als K4_K_M etwa 44 GB oder weniger – bleiben 80 GB für Kontext (vermutlich 128K) und die IDE.

Replies (0)

No replies.