@saagar@federated.saagarjha.com
Post #3933702
2026-07-16 21:01 UTC
I don’t know about you but if my AI compiler got 30 TFLOPs on a 4096x4096x4096 matrix multiply I might hesitate to say it “rivals Triton’s extensively optimized stack”
Replies (1)
-
@saagar@federated.saagarjha.com 2026-07-16 21:10
Kimi K3 can build a coherent end-to-end compiler* – from DSL frontend and IR passes to PTX codegen† and runtime‡ – rather than isolated kernels; its from-scratch§ Tensor Core¶ path *No you can’t see it †We used MLIR ‡And NVRTC §We gave it the Triton codebase ¶Not actually used