Anthropic · Topic 5 of 5
Evaluation, Quality, and Continuous Improvement
Measuring and improving quality over time: eval harnesses, LLM-as-judge, regression and canary/A-B testing, dataset curation, and the fine-tuning vs prompting vs distillation decision.
5 lessons150 questions
What this topic covers
- 01Building Eval Harnesses300m
- 02LLM-as-judge and Rubric Scoring300m
- 03Regression, Canary, and A/B Testing360m
- 04Dataset Curation and Feedback Loops360m
- 05Fine-tuning vs Prompting vs Distillation360m