bootstrap-evaluator-study
Python
★ 0
updated 11d ago
Does bootstrapped LLM self-improvement need a ground-truth (reality) evaluator, not a self-referential proxy? Five experiments on MBPP + Qwen2.5-Coder.
No plain-English explanation yet — one is being written right now. Check back in a minute.