Curso · 5 capítulos
Evaluación de LLMs
Crea evaluaciones de LLM ejecutables en las que puedas confiar: conjuntos de datos de referencia, scorers deterministas, jueces LLM calibrados, suites de Inspect AI y controles de CI. 5 capítulos, nivel avanzado, para ingenieros.
Lo que sabrás hacer
- Crea una eval de LLM ejecutable desde cero
- Diseña rúbricas de juez resistentes al sesgo
- Calibra jueces LLM frente a evaluadores humanos
- Ejecuta suites de eval con Inspect AI
- Bloquea merges problemáticos con evals de CI
- Define umbrales que sobrevivan a jueces inestables
Qué incluye
- 1Evaluación de LLMs: Empieza Aquí
Una orientación de 12 minutos al skill path de Evaluación de LLMs — el capítulo de acceso, luego las tres capas (judges, suites, gates) que convierten el eval-por-intuición en una disciplina que se puede lanzar.
- 2Fundamentos de evals: tu primera eval de LLM en 30 minutos
Deja de revisar outputs por intuición. Construye una eval ejecutable — dataset dorado, scorer determinista, juez LLM — y lee el resultado como un ingeniero.
- 3LLM-as-Judge: Rúbricas, Sesgos y Confiabilidad
Diseña jueces que sobrevivan los sesgos CALM, se calibren contra humanos y ganen un lugar en tu gate de CI.
- 4Inspect AI: Suites de Eval de Producción a Escala
Crea, ejecuta y visualiza suites de eval de nivel frontera con el framework open-source de UK AISI.
- 5Eval Gating en CI: Bloquear Merges Malos
Cablear evals por-PR en GitHub Actions, elegir umbrales que sobreviven al flakiness, y decidir cuándo un gate pertenece en main.
Preguntas frecuentes
- ¿Qué aprenderé en este curso de evaluación de LLMs?
- Construirás evaluaciones en tres capas: una primera eval ejecutable con un conjunto de datos de referencia y un scorer, rúbricas LLM-as-judge fiables calibradas frente a valoraciones humanas, y suites de eval integradas en CI como control de merge. El recorrido usa el framework open-source Inspect AI del UK AISI y GitHub Actions.
- ¿A quién va dirigido este curso?
- Está dirigido a ingenieros que desarrollan funcionalidades de AI en producción y necesitan probar los outputs de LLMs de forma rigurosa en lugar de evaluarlas a ojo. El nivel es avanzado, con foco en ingeniería de software y fiabilidad de AI.
- ¿Necesito saber programar para hacer este curso?
- Sí. Es un recorrido de ingeniería práctico que implica escribir scripts de eval, configurar el framework Inspect AI y definir workflows de GitHub Actions, por lo que se espera que te manejes con código y CI.
- ¿Cuánto dura el curso y hay certificado?
- El recorrido tiene 5 capítulos con una duración total de unos 100 minutos, comenzando con una orientación de 12 minutos. Al completarlo, obtienes un certificado de AI Academy by Anthropos.
- ¿Este curso es gratuito?
- No, es un skill path de pago incluido en la suscripción a AI Academy by Anthropos.
Consigue un certificado
Completa todos los capítulos para recibir tu certificado de finalización.