• Talk
  • 2026

Architettura AI “Switchabile”: Routing Dinamico, RAG Locale e Ottimizzazione TCO tra Cloud e On-Premise

Speaker:

Tematiche:

  • Infrastruttura per LLM

Abstract

Come passare da chat isolate a workflow strutturati e resilienti? Il talk presenta un’architettura self-hosted in Docker che utilizza LiteLLM come orchestratore dinamico per switchare tra modelli Cloud (per task complessi) e modelli Locali (Ollama/vLLM) per task ripetitivi. Attraverso l’integrazione di n8n, MCP e un RAG locale applicato al ciclo di sviluppo (SDLC), vedremo dati reali su costi e latenze monitorati con Langfuse e Grafana. L’obiettivo è dimostrare come abbattere il TCO, garantire la data residency e trasformare le interazioni quotidiane in un “Data Flywheel” proprietario per il fine-tuning.

Talk correlati 2026