• Talk
  • 2026

Ricerca semantica su un milione di video con due GPU consumer: si può fare

Speaker:

Abstract

Come orchestrare un workflow distribuito che fonde Go, Python e CUDA su hardware eterogeneo per indicizzare semanticamente milioni di video? Serve davvero un H100 per fare inferenza VLM in produzione?
Nel talk mostrerò come scegliere i modelli giusti per ogni stadio della pipeline (scene detection, captioning vision-language, structured extraction, embeddings ibridi dense+sparse) e come spremere il massimo da llama.cpp e vLLM tra prefix caching, quantizzazione e grammar-constrained decoding.

Talk correlati 2026