Curso · 5 capítulos

Evaluación de LLMs

Crea evaluaciones de LLM ejecutables en las que puedas confiar: conjuntos de datos de referencia, scorers deterministas, jueces LLM calibrados, suites de Inspect AI y controles de CI. 5 capítulos, nivel avanzado, para ingenieros.

De pagoadvanced5 capítulos100 minInglés + 6 idiomasCertificado al completar

Lo que sabrás hacer

  • Crea una eval de LLM ejecutable desde cero
  • Diseña rúbricas de juez resistentes al sesgo
  • Calibra jueces LLM frente a evaluadores humanos
  • Ejecuta suites de eval con Inspect AI
  • Bloquea merges problemáticos con evals de CI
  • Define umbrales que sobrevivan a jueces inestables

Qué incluye

  1. 1
    Evaluación de LLMs: Empieza Aquí

    Una orientación de 12 minutos al skill path de Evaluación de LLMs — el capítulo de acceso, luego las tres capas (judges, suites, gates) que convierten el eval-por-intuición en una disciplina que se puede lanzar.

    12 min
  2. 2
    Fundamentos de evals: tu primera eval de LLM en 30 minutos

    Deja de revisar outputs por intuición. Construye una eval ejecutable — dataset dorado, scorer determinista, juez LLM — y lee el resultado como un ingeniero.

    22 min
  3. 3
    LLM-as-Judge: Rúbricas, Sesgos y Confiabilidad

    Diseña jueces que sobrevivan los sesgos CALM, se calibren contra humanos y ganen un lugar en tu gate de CI.

    22 min
  4. 4
    Inspect AI: Suites de Eval de Producción a Escala

    Crea, ejecuta y visualiza suites de eval de nivel frontera con el framework open-source de UK AISI.

    22 min
  5. 5
    Eval Gating en CI: Bloquear Merges Malos

    Cablear evals por-PR en GitHub Actions, elegir umbrales que sobreviven al flakiness, y decidir cuándo un gate pertenece en main.

    22 min

Preguntas frecuentes

¿Qué aprenderé en este curso de evaluación de LLMs?
Construirás evaluaciones en tres capas: una primera eval ejecutable con un conjunto de datos de referencia y un scorer, rúbricas LLM-as-judge fiables calibradas frente a valoraciones humanas, y suites de eval integradas en CI como control de merge. El recorrido usa el framework open-source Inspect AI del UK AISI y GitHub Actions.
¿A quién va dirigido este curso?
Está dirigido a ingenieros que desarrollan funcionalidades de AI en producción y necesitan probar los outputs de LLMs de forma rigurosa en lugar de evaluarlas a ojo. El nivel es avanzado, con foco en ingeniería de software y fiabilidad de AI.
¿Necesito saber programar para hacer este curso?
Sí. Es un recorrido de ingeniería práctico que implica escribir scripts de eval, configurar el framework Inspect AI y definir workflows de GitHub Actions, por lo que se espera que te manejes con código y CI.
¿Cuánto dura el curso y hay certificado?
El recorrido tiene 5 capítulos con una duración total de unos 100 minutos, comenzando con una orientación de 12 minutos. Al completarlo, obtienes un certificado de AI Academy by Anthropos.
¿Este curso es gratuito?
No, es un skill path de pago incluido en la suscripción a AI Academy by Anthropos.

Consigue un certificado

Completa todos los capítulos para recibir tu certificado de finalización.