Corso · 5 capitoli
Valutazione degli LLM
Costruisci valutazioni LLM affidabili e funzionanti: dataset di riferimento, valutatori deterministici, giudici LLM calibrati, suite Inspect AI e controlli CI. 5 capitoli, livello avanzato, per sviluppatori.
Cosa saprai fare
- Crea una valutazione LLM funzionante da zero
- Progetta rubriche di valutazione robuste e imparziali
- Calibra i giudici LLM rispetto a valutatori umani
- Esegui suite di valutazione con Inspect AI
- Blocca rilasci problematici con controlli CI
- Imposta soglie stabili anche con giudici instabili
Cosa contiene
- 1Valutazione LLM: parti da qui
Un orientamento di 12 minuti al percorso Valutazione LLM — il capitolo di ingresso, poi i tre strati (judge, suite, gate) che trasformano l'eval a sentimento in una disciplina che rilascia.
- 2Le basi degli eval: il tuo primo eval LLM in 30 minuti
Smetti di controllare gli output a sentimento. Costruisci un eval (valutazione) che gira davvero — golden dataset, scorer deterministico, judge LLM — e leggi il risultato da ingegnere.
- 3LLM-as-Judge: rubriche, bias e affidabilità
Progetta judge che sopravvivono ai bias CALM, calibrati contro gli umani, e che si guadagnano un posto nel tuo gate in CI.
- 4Inspect AI: suite di eval in produzione, a scala
Scrivi, esegui e visualizza suite di eval di livello frontiera con il framework open-source di UK AISI.
- 5Eval Gating in CI: bloccare i merge sbagliati
Collega gli eval per-PR a GitHub Actions, scegli soglie che reggono alla flakiness e decidi quando un gate ha senso su main.
Domande frequenti
- Cosa imparerò in questo corso sulla valutazione LLM?
- Costruirai un sistema di valutazione su tre livelli: una prima valutazione funzionante con un dataset di riferimento e un valutatore deterministico, rubriche LLM-as-judge affidabili calibrate su giudizi umani, e suite di valutazione integrate nella pipeline CI come controllo pre-rilascio. Il percorso utilizza il framework open-source Inspect AI di UK AISI e GitHub Actions.
- A chi è rivolto questo corso?
- È pensato per sviluppatori che realizzano funzionalità AI in produzione e hanno bisogno di testare gli output LLM in modo rigoroso, senza affidarsi all'istinto. Il livello è avanzato, con un approccio orientato all'ingegneria del software e all'affidabilità dei sistemi AI.
- Devo saper programmare per seguire questo corso?
- Sì. È un percorso pratico per sviluppatori: prevede la scrittura di script di valutazione, la configurazione del framework Inspect AI e la creazione di workflow con GitHub Actions. È richiesta familiarità con il codice e le pipeline CI.
- Quanto dura il corso ed è previsto un certificato?
- Il percorso comprende 5 capitoli per un totale di circa 100 minuti, a partire da un'introduzione di 12 minuti. Al completamento ricevi un certificato AI Academy by Anthropos.
- Il corso è gratuito?
- No, è un percorso a pagamento incluso nell'abbonamento AI Academy by Anthropos.
Ottieni un certificato
Completa tutti i capitoli per ricevere il tuo certificato di completamento.