gitmyhub

bootstrap-evaluator-study

Python ★ 0 updated 11d ago

Does bootstrapped LLM self-improvement need a ground-truth (reality) evaluator, not a self-referential proxy? Five experiments on MBPP + Qwen2.5-Coder.

No plain-English explanation yet — one is being written right now. Check back in a minute.