gitmyhub

quadbit

Python ★ 3 updated 9d ago

The only deployed sparse FP4 GEMM on SM120: beats CUTLASS 80b on every shape, wins end-to-end request latency in 81 of 112 serving regimes vs dense NVFP4.

No plain-English explanation yet — one is being written right now. Check back in a minute.