Skip to main content

04-evaluation-runs

Use when running mlflow.genai.evaluate() to test agent quality before deployment. Covers the predict_fn contract, answer-sheet mode for re-scoring existing outputs, threshold gates, retry wrappers, human feedback sessions, and conversation evaluation — even if you just want "run my benchmarks and tell me pass or fail." Also use when collecting human labels to calibrate automated scorers. SDLC Step 4.

Ir a la instalación

Datos de origen

Repositorio
databricks-solutions/vibe-coding-workshop-template
Última actividad en el origen
31 de agosto de 2026 a las 04:03
Idioma detectado de SKILL.md
inglés
Estrellas
6
Forks
7

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.