• Talk
  • 2026

Benchmarking di LLM: un approccio data-driven alla selezione dei modelli per deployment on-premise

  • Lingua
    Italiano

Speaker:

Tematiche:

  • Infrastruttura per LLM

Abstract

Quale LLM mettiamo in produzione?” Se il tuo team risponde a questa domanda con blog post, demo dei vendor o intuizioni, stai costruendo su sabbie mobili. Scegliere un modello senza una valutazione strutturata è il nuovo debito tecnico: invisibile finché non si rompe in produzione.

I modelli open-source variano enormemente tra dimensioni diverse: un modello che eccelle nel ragionamento può fallire nel seguire istruzioni precise o nel chiamare tool con i parametri corretti. Un modello con benchmark impressionanti può servire le richieste molte volte più lentamente di un’alternativa, sullo stesso hardware. Questi gap sono invisibili senza una valutazione sistematica e multidimensionale.

In questo talk presento una pipeline di valutazione riproducibile per rendere la selezione dei modelli una decisione ingegneristica. L’architettura dual-track copre più dimensioni di capability: ragionamento, generazione di codice, instruction following, tool use, conoscenza di dominio; affiancate da benchmark di dominio specifici (accuratezza text-to-SQL con esecuzione reale) e di performance di serving sotto carico. Tutti i modelli girano sullo stesso hardware on-premise, garantendo confronti apples-to-apples.

I partecipanti impareranno: come progettare una suite di benchmark ancorata ai requisiti reali di produzione; dati concreti su dove i principali LLM open-source eccellono e falliscono; i pattern di tooling che rendono la valutazione riproducibile, auditabile e condivisibile in team, il tutto senza inviare un singolo byte al cloud.

Talk correlati 2026