Building & Running AI intermediate

Chunking

Splitting documents into passages small enough to embed and retrieve usefully.

Il chunking è il passaggio meno affascinante e più determinante di una pipeline RAG. I chunk troppo grandi diluiscono l’embedding e sprecano contesto; quelli troppo piccoli perdono il significato che li rendeva rilevanti. Suddividere seguendo la struttura — titoli, sezioni — funziona meglio che suddividere in base al numero di caratteri.

In pratica: Tagliare un contratto a metà clausola, così il recupero restituisce mezza frase che non significa nulla.