Agenti AI event-driven: orchestrazione di agenti con contesto di grandi dimesioni su larga scala
Agenti AI event-driven: orchestrazione di agenti con contesto di grandi dimesioni su larga scalaSpeaker:

Luca Bianchi
CTIO @ MESA
Speaker:

Fabio Carta
Senior AI Engineer @ Agile Lab
Tematiche:
Quale LLM mettiamo in produzione?” Se il tuo team risponde a questa domanda con blog post, demo dei vendor o intuizioni, stai costruendo su sabbie mobili. Scegliere un modello senza una valutazione strutturata è il nuovo debito tecnico: invisibile finché non si rompe in produzione.
I modelli open-source variano enormemente tra dimensioni diverse: un modello che eccelle nel ragionamento può fallire nel seguire istruzioni precise o nel chiamare tool con i parametri corretti. Un modello con benchmark impressionanti può servire le richieste molte volte più lentamente di un’alternativa, sullo stesso hardware. Questi gap sono invisibili senza una valutazione sistematica e multidimensionale.
In questo talk presento una pipeline di valutazione riproducibile per rendere la selezione dei modelli una decisione ingegneristica. L’architettura dual-track copre più dimensioni di capability: ragionamento, generazione di codice, instruction following, tool use, conoscenza di dominio; affiancate da benchmark di dominio specifici (accuratezza text-to-SQL con esecuzione reale) e di performance di serving sotto carico. Tutti i modelli girano sullo stesso hardware on-premise, garantendo confronti apples-to-apples.
I partecipanti impareranno: come progettare una suite di benchmark ancorata ai requisiti reali di produzione; dati concreti su dove i principali LLM open-source eccellono e falliscono; i pattern di tooling che rendono la valutazione riproducibile, auditabile e condivisibile in team, il tutto senza inviare un singolo byte al cloud.