gitmyhub

mechreward

Jupyter Notebook ★ 6 updated 2mo ago

Mechanistic interpretability as reward signal for RL training of LLMs — SAE features + GRPO + anti-Goodhart framework

No plain-English explanation yet — one is being written right now. Check back in a minute.