promptfoo
★ 0
updated 2y ago
⑂ fork
Test your prompts, models, and RAGs. Catch regressions and improve prompt quality. LLM evals for OpenAI, Azure, Anthropic, Gemini, Mistral, Llama, Bedrock, Ollama, and other local & private models with CI/CD integration.
No plain-English explanation yet — one is being written right now. Check back in a minute.