RAG (Retrieval-Augmented Generation)

Detto anche: RAG, retrieval-augmented generation, generazione aumentata dal recupero

La generazione aumentata dal recupero (in inglese retrieval-augmented generation, RAG) è una tecnica in cui, prima di rispondere, il sistema cerca i documenti pertinenti e li passa al modello insieme alla domanda. Così le risposte si basano su informazioni aggiornate e verificabili.

In breve

Come funziona un sistema RAG?

I documenti (manuali, procedure, contratti) vengono divisi in brani e indicizzati. Quando arriva una domanda, il sistema recupera i brani più pertinenti e costruisce un prompt con la domanda e quei brani; il modello risponde usando quel materiale e può citarlo.

Perché si usa?

Perché un modello non conosce i documenti interni di un'azienda e le sue conoscenze si fermano alla data di addestramento. Il RAG aggiunge al momento le informazioni giuste, senza dover addestrare di nuovo il modello, e riduce le allucinazioni.

Da dove viene?

Il nome viene da uno studio del 2020 di ricercatori di Facebook AI Research (oggi Meta), University College London e New York University.

Esempio pratico

Un assistente per il personale riceve «Quanti giorni di permesso ho per un trasloco?». Il sistema recupera l'articolo del regolamento aziendale e quello del contratto collettivo, e il modello risponde citando entrambi.

Differenze con Affinamento del modello (fine-tuning)

Confronto tra RAG (Retrieval-Augmented Generation) e Affinamento del modello (fine-tuning)
AspettoRAG (Retrieval-Augmented Generation)Affinamento del modello (fine-tuning)
Cosa cambiaLe informazioni date al modelloIl modello stesso
AggiornamentoBasta aggiornare i documentiServe un nuovo addestramento
Citare le fontiFacileDifficile

Domande frequenti

Caricare un PDF in una chat è RAG?

È una forma semplice dello stesso principio: dare al modello il documento su cui rispondere. Il RAG vero e proprio cerca automaticamente in archivi grandi.

Fonti

  1. Lewis e altri, «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks» (2020)
  2. Huang e altri, «A Survey on Hallucination in Large Language Models» (2023)

Vedi anche