gitmyhub

pxq_llama.cpp

C++ ★ 12 updated 5d ago

PXQ: PXA-native low-bit MoE quants (2/3/4-bit, E16-row scales) + fused CUDA kernels for Pascal/Volta — run a real 35B on a salvaged 12-16GB card. Fork of ik_llama.cpp.

No plain-English explanation yet — one is being written right now. Check back in a minute.