quadbit
Python
★ 3
updated 9d ago
The only deployed sparse FP4 GEMM on SM120: beats CUTLASS 80b on every shape, wins end-to-end request latency in 81 of 112 serving regimes vs dense NVFP4.
No plain-English explanation yet — one is being written right now. Check back in a minute.