• Talk
  • 2026

Cost-Aware MLOps: ottimizzare inference e pipeline ML

Speaker:

Tematiche:

  • Infrastruttura per LLM

Abstract

Nel contesto MLOps, il costo non è solo una metrica finanziaria ma un vincolo architetturale che impatta direttamente scalabilità, affidabilità e velocità di delivery. Con questo talk, andremo ad affrontare in modo pratico come integrare l’ottimizzazione dei costi all’interno del lifecycle ML, dalle pipeline di training fino ai servizi di inference in produzione.

Partendo da una pipeline MLOps reale, analizzeremo come introdurre pratiche di cost-awareness in ogni fase: versioning e selezione dei modelli, validazione automatica con metriche costo-performance, e strategie di deploy progressive per valutare il costo per prediction in ambienti reali.
Entreremo nel dettaglio delle tecniche di model optimization e di come integrarle nelle pipeline CI/CD dei modelli, per poi descrivere, a livello infrastrutturale, pattern avanzati per l’inference. Insomma, ne vedremo delle belle!

Talk correlati 2026