Agenti AI event-driven: orchestrazione di agenti con contesto di grandi dimesioni su larga scala
Agenti AI event-driven: orchestrazione di agenti con contesto di grandi dimesioni su larga scalaSpeaker:

Luca Bianchi
CTIO @ MESA
Speaker:

Tommaso Doninelli
IT Consultant & Senior Platform Engineer
Come orchestrare un workflow distribuito che fonde Go, Python e CUDA su hardware eterogeneo per indicizzare semanticamente milioni di video? Serve davvero un H100 per fare inferenza VLM in produzione?
Nel talk mostrerò come scegliere i modelli giusti per ogni stadio della pipeline (scene detection, captioning vision-language, structured extraction, embeddings ibridi dense+sparse) e come spremere il massimo da llama.cpp e vLLM tra prefix caching, quantizzazione e grammar-constrained decoding.