• Talk
  • 2026

Unit Economics degli LLM on-premise: misurare il valore reale dell’AI locale

Speaker:

  • Andrea Saravalle, Economista applicato, PhD e Professore a contratto @ Università di Bologna / Università di Brescia / Università Politecnica delle Marche

Tematiche:

  • Infrastruttura per LLM

Abstract

Portare un LLM on-premise in produzione richiede una capacità rara: leggere insieme architettura tecnica, vincoli organizzativi e sostenibilità economica.
Il talk propone un framework di unit economics per valutare gli LLM on-premise oltre la logica dei benchmark, collegando costo dell’inferenza, saturazione GPU, qualità del retrieval, latenza, data residency, compliance, manutenzione e continuità operativa. La domanda guida è semplice e decisiva: quanto costa una risposta realmente utile?
La sessione traduce questa domanda in una matrice operativa per confrontare build, buy e hybrid approach. Verranno analizzati i principali driver di costo e valore: hardware selection, GPU pooling, serving, RAG, caching, vector database, monitoring, access control, aggiornamento dei modelli, costo degli errori e debito operativo. Un esempio numerico semplificato mostrerà come cambiano le decisioni al variare di volume delle richieste, utilizzo dell’infrastruttura, latenza e qualità delle risposte.
Il takeaway è un modello decisionale applicabile da team MLOps, CTO, solution architect e consulenti per progettare AI on-premise con maggiore controllo dei costi, maggiore consapevolezza dei trade-off e maggiore capacità di trasformare infrastruttura in valore reale.

Talk correlati 2026