Curso · 5 capítulos
Avaliação de LLMs
Crie avaliações de LLM confiáveis e executáveis: datasets gold, scorers determinísticos, juízes LLM calibrados, suites com Inspect AI e CI gates. 5 capítulos, avançado, para engenheiros.
O que você vai saber fazer
- Crie uma avaliação de LLM executável do zero
- Projete rubricas de juiz que resistem a vieses
- Calibre juízes LLM com avaliações humanas
- Execute suites de avaliação com Inspect AI
- Bloqueie merges ruins com CI gates
- Defina limiares que sobrevivem a juízes instáveis
O que tem dentro
- 1Avaliação de LLMs: comece aqui
Uma orientação de 12 minutos ao skill path de avaliação de LLMs — o capítulo de entrada, depois as três camadas (judges, suites, gates) que transformam eval-por-vibes numa disciplina que entrega resultado.
- 2Fundamentos de Evals: Sua Primeira Eval de LLM em 30 Minutos
Pare de avaliar outputs na intuição. Monte uma eval executável — dataset golden, scorer determinístico, juiz LLM — e leia o resultado como engenheiro.
- 3LLM-as-Judge: Rubricas, Vieses e Confiabilidade
Projete juízes que sobrevivem aos vieses CALM, calibre contra humanos e conquiste um lugar no seu CI gate.
- 4Inspect AI: Suítes de Eval em Produção e Escala
Crie, execute e visualize suítes de eval de nível frontier com o framework open-source do UK AISI.
- 5Eval Gating em CI: Bloqueando Merges Ruins
Conecte evals por PR no GitHub Actions, defina thresholds que sobrevivem à flakiness e decida quando um gate pertence à main.
Perguntas frequentes
- O que vou aprender neste curso de avaliação de LLM?
- Você constrói avaliações em três camadas: uma primeira avaliação executável com dataset gold e scorer, rubricas LLM-as-judge confiáveis calibradas com avaliações humanas, e suites de avaliação integradas ao CI como gate de merge. A trilha usa o framework open-source Inspect AI do UK AISI e GitHub Actions.
- Para quem é este curso?
- É para engenheiros que desenvolvem funcionalidades de IA em produção e precisam testar outputs de LLM com rigor, em vez de avaliá-los no achismo. O nível é avançado, com foco em engenharia de software e confiabilidade de IA.
- Preciso saber programar para fazer este curso?
- Sim. Esta é uma trilha prática de engenharia que envolve escrever scripts de avaliação, configurar o framework Inspect AI e criar workflows no GitHub Actions, portanto é esperado que você tenha familiaridade com código e CI.
- Qual é a duração do curso e há certificado?
- A trilha tem 5 capítulos com cerca de 100 minutos no total, começando com uma orientação de 12 minutos. Ao concluir, você recebe um certificado da AI Academy by Anthropos.
- Este curso é gratuito?
- Não, esta é uma trilha paga incluída na assinatura da AI Academy by Anthropos.
Ganhe um certificado
Conclua todos os capítulos para receber seu certificado de conclusão.