• Talk
  • 2026

How I Learned to Stop Worrying and Ship AI Agents to Production

Speaker:

Tematiche:

  • Deployment di LLM

Abstract

Gli agenti AI sono finalmente abbastanza potenti da sostituire i workflow rigidi, ma solo con la giusta infrastruttura software. In questo talk mostrerò come dotare un LLM di un harness efficace (prompt, tools, middleware) e come affiancarlo a un runtime production-ready (durable execution, checkpointing, tracing & observability), attraverso due case study reali costruiti su stack open-source.

Il primo è un Insurance Assistant: qui l’approccio è più vicino a un workflow orchestrato che a un agente libero. Con CrewAI abbiamo definito un workflow, dove ogni sinistro in ingresso è scomposto in tasks delegati a subagent specializzati (verifica copertura, data extraction, calcolo del rimborso). La sfida centrale in questo tipo di agenti è garantirne il trust: ogni risposta è corredata da citazioni alle sorgenti, il reasoning è tracciato, e un loop di valutazione continua (LLM-as-judge, golden dataset, human review) ci ha permesso di misurare e migliorare la qualità nel tempo.

Il secondo è un Data Analysis Agent conversazionale: gli utenti interrogano dataset complessi in linguaggio naturale e ottengono grafici e tabelle interattive con cui interagire. È il caso architetturalmente più ricco: l’agente, costruito con LangGraph, gestisce sessioni long-running con memoria persistente, subagent paralleli per le query heavy, e gestione efficace del context window. Il tutto è tracciato end-to-end con MLflow, che ci ha permesso di debuggare loop inaspettati e misurare la qualità delle risposte nel tempo. Mostrerò anche come si è passati da un pilot con Chainlit, evoluto poi in un’app React + FastAPI custom.

I partecipanti avranno modo di approfondire pattern concreti su harness design, delegation a subagent, memory management e monitoring, e capiranno perché l’infrastruttura attorno all’LLM conta quanto l’LLM stesso.

Talk correlati 2026