Corso · 5 capitoli

Valutazione degli LLM

Costruisci valutazioni LLM affidabili e funzionanti: dataset di riferimento, valutatori deterministici, giudici LLM calibrati, suite Inspect AI e controlli CI. 5 capitoli, livello avanzato, per sviluppatori.

A pagamentoadvanced5 capitoli100 minInglese + 6 lingueCertificato al completamento

Cosa saprai fare

  • Crea una valutazione LLM funzionante da zero
  • Progetta rubriche di valutazione robuste e imparziali
  • Calibra i giudici LLM rispetto a valutatori umani
  • Esegui suite di valutazione con Inspect AI
  • Blocca rilasci problematici con controlli CI
  • Imposta soglie stabili anche con giudici instabili

Cosa contiene

  1. 1
    Valutazione LLM: parti da qui

    Un orientamento di 12 minuti al percorso Valutazione LLM — il capitolo di ingresso, poi i tre strati (judge, suite, gate) che trasformano l'eval a sentimento in una disciplina che rilascia.

    12 min
  2. 2
    Le basi degli eval: il tuo primo eval LLM in 30 minuti

    Smetti di controllare gli output a sentimento. Costruisci un eval (valutazione) che gira davvero — golden dataset, scorer deterministico, judge LLM — e leggi il risultato da ingegnere.

    22 min
  3. 3
    LLM-as-Judge: rubriche, bias e affidabilità

    Progetta judge che sopravvivono ai bias CALM, calibrati contro gli umani, e che si guadagnano un posto nel tuo gate in CI.

    22 min
  4. 4
    Inspect AI: suite di eval in produzione, a scala

    Scrivi, esegui e visualizza suite di eval di livello frontiera con il framework open-source di UK AISI.

    22 min
  5. 5
    Eval Gating in CI: bloccare i merge sbagliati

    Collega gli eval per-PR a GitHub Actions, scegli soglie che reggono alla flakiness e decidi quando un gate ha senso su main.

    22 min

Domande frequenti

Cosa imparerò in questo corso sulla valutazione LLM?
Costruirai un sistema di valutazione su tre livelli: una prima valutazione funzionante con un dataset di riferimento e un valutatore deterministico, rubriche LLM-as-judge affidabili calibrate su giudizi umani, e suite di valutazione integrate nella pipeline CI come controllo pre-rilascio. Il percorso utilizza il framework open-source Inspect AI di UK AISI e GitHub Actions.
A chi è rivolto questo corso?
È pensato per sviluppatori che realizzano funzionalità AI in produzione e hanno bisogno di testare gli output LLM in modo rigoroso, senza affidarsi all'istinto. Il livello è avanzato, con un approccio orientato all'ingegneria del software e all'affidabilità dei sistemi AI.
Devo saper programmare per seguire questo corso?
Sì. È un percorso pratico per sviluppatori: prevede la scrittura di script di valutazione, la configurazione del framework Inspect AI e la creazione di workflow con GitHub Actions. È richiesta familiarità con il codice e le pipeline CI.
Quanto dura il corso ed è previsto un certificato?
Il percorso comprende 5 capitoli per un totale di circa 100 minuti, a partire da un'introduzione di 12 minuti. Al completamento ricevi un certificato AI Academy by Anthropos.
Il corso è gratuito?
No, è un percorso a pagamento incluso nell'abbonamento AI Academy by Anthropos.

Ottieni un certificato

Completa tutti i capitoli per ricevere il tuo certificato di completamento.