Curso · 5 capítulos

Avaliação de LLMs

Crie avaliações de LLM confiáveis e executáveis: datasets gold, scorers determinísticos, juízes LLM calibrados, suites com Inspect AI e CI gates. 5 capítulos, avançado, para engenheiros.

Pagoadvanced5 capítulos100 minInglês + 6 idiomasCertificado ao concluir

O que você vai saber fazer

  • Crie uma avaliação de LLM executável do zero
  • Projete rubricas de juiz que resistem a vieses
  • Calibre juízes LLM com avaliações humanas
  • Execute suites de avaliação com Inspect AI
  • Bloqueie merges ruins com CI gates
  • Defina limiares que sobrevivem a juízes instáveis

O que tem dentro

  1. 1
    Avaliação de LLMs: comece aqui

    Uma orientação de 12 minutos ao skill path de avaliação de LLMs — o capítulo de entrada, depois as três camadas (judges, suites, gates) que transformam eval-por-vibes numa disciplina que entrega resultado.

    12 min
  2. 2
    Fundamentos de Evals: Sua Primeira Eval de LLM em 30 Minutos

    Pare de avaliar outputs na intuição. Monte uma eval executável — dataset golden, scorer determinístico, juiz LLM — e leia o resultado como engenheiro.

    22 min
  3. 3
    LLM-as-Judge: Rubricas, Vieses e Confiabilidade

    Projete juízes que sobrevivem aos vieses CALM, calibre contra humanos e conquiste um lugar no seu CI gate.

    22 min
  4. 4
    Inspect AI: Suítes de Eval em Produção e Escala

    Crie, execute e visualize suítes de eval de nível frontier com o framework open-source do UK AISI.

    22 min
  5. 5
    Eval Gating em CI: Bloqueando Merges Ruins

    Conecte evals por PR no GitHub Actions, defina thresholds que sobrevivem à flakiness e decida quando um gate pertence à main.

    22 min

Perguntas frequentes

O que vou aprender neste curso de avaliação de LLM?
Você constrói avaliações em três camadas: uma primeira avaliação executável com dataset gold e scorer, rubricas LLM-as-judge confiáveis calibradas com avaliações humanas, e suites de avaliação integradas ao CI como gate de merge. A trilha usa o framework open-source Inspect AI do UK AISI e GitHub Actions.
Para quem é este curso?
É para engenheiros que desenvolvem funcionalidades de IA em produção e precisam testar outputs de LLM com rigor, em vez de avaliá-los no achismo. O nível é avançado, com foco em engenharia de software e confiabilidade de IA.
Preciso saber programar para fazer este curso?
Sim. Esta é uma trilha prática de engenharia que envolve escrever scripts de avaliação, configurar o framework Inspect AI e criar workflows no GitHub Actions, portanto é esperado que você tenha familiaridade com código e CI.
Qual é a duração do curso e há certificado?
A trilha tem 5 capítulos com cerca de 100 minutos no total, começando com uma orientação de 12 minutos. Ao concluir, você recebe um certificado da AI Academy by Anthropos.
Este curso é gratuito?
Não, esta é uma trilha paga incluída na assinatura da AI Academy by Anthropos.

Ganhe um certificado

Conclua todos os capítulos para receber seu certificado de conclusão.