Il RAG (Retrieval-Augmented Generation) e la tecnica che permette ai grandi modelli linguistici di rispondere con conoscenza specifica di dominio. Invece di affidarsi solo alla conoscenza generica del modello, il sistema recupera dinamicamente i documenti rilevanti al momento della query e li passa al modello come contesto.

I componenti di un sistema RAG

Document ingestion pipeline: i documenti (PDF, Word, pagine web, database) vengono processati, suddivisi in frammenti e trasformati in vettori numerici tramite un modello di embedding.

Vector database: archivia i vettori e permette la ricerca per similarita semantica. Soluzioni popolari: Pinecone, Weaviate, Chroma, Qdrant, pgvector.

Retrieval: ad ogni query, il sistema trova i chunk piu simili alla domanda usando la distanza coseno tra vettori.

Generation: il modello LLM riceve il contesto recuperato piu la domanda originale e genera una risposta basata su quell'informazione specifica.

Casi d'uso aziendali concreti

Assistente su knowledge base interna (procedure, policy, FAQ), chatbot su catalogo prodotti, supporto legale su contratti e normative, motore di ricerca intelligente su documentazione tecnica, onboarding di nuovi dipendenti.

Quando il RAG funziona bene (e quando no)

Funziona ottimamente quando i documenti sono ben strutturati e di buona qualita, le domande hanno risposte contenute nei documenti, e il dominio e ben definito. Funziona meno bene su documenti mal scritti o contraddittori, o su domande che richiedono ragionamento su molti documenti contemporaneamente.