sabot
Python
★ 0
updated 10d ago
Do your agent pipeline's own checks catch planted faults? Measured on LangGraph, CrewAI and AutoGen: median 16.7%. One prompt-level change takes it to 55.0%. Pre-registered spec, Apache-2.0 harness, every raw trace published.
No plain-English explanation yet — one is being written right now. Check back in a minute.