Elektrine lite

← Feed

@saagar@federated.saagarjha.com

Post #3933702

2026-07-16 21:01 UTC

I don’t know about you but if my AI compiler got 30 TFLOPs on a 4096x4096x4096 matrix multiply I might hesitate to say it “rivals Triton’s extensively optimized stack”

Replies (1)

  • Kimi K3 can build a coherent end-to-end compiler* – from DSL frontend and IR passes to PTX codegen† and runtime‡ – rather than isolated kernels; its from-scratch§ Tensor Core¶ path *No you can’t see it †We used MLIR ‡And NVRTC §We gave it the Triton codebase ¶Not actually used

    Open ##3933714