Ugrás a tartalomhoz
← Vissza a blogra
Alkalmazások 2026. május 25. · 7 perces olvasás

Privát tudásasszisztens építése RAG-gal

Alakítsa dokumentumait olyan privát asszisztenssé, amely idézetekkel válaszol – anélkül, hogy bármit a felhőbe küldene.

Privát tudásasszisztens építése RAG-gal

Képzelje el, hogy feltesz egy kérdést, és olyan választ kap, amely a belső szabályzatából, a termékspecifikációjából vagy a negyedéves auditjelentéséből idézi a pontos bekezdést – mindezt anélkül, hogy egyetlen bájt is elhagyja a szervertermét. Ez a Retrieval-Augmented Generation (RAG) ígérete, és a teljesen on-premise futó Privonis-szal ez most elérhető minden olyan európai vállalat számára, amely komolyan veszi az adatszuverenitást.

Mi a RAG, és miért fontos?

A nagy nyelvi modellek erős gondolkodók, de csak azt tudják, amire megtanítottak. A RAG ezt úgy javítja ki, hogy lekérdezési időben releváns részleteket vesz elő a saját dokumentumtárából, és kontextusként adja át a modellnek. A modell ezután ezekre a részletekre alapozva válaszol, forrásokat idézve, nem pedig tényeket hallucinálja. Az eredmény egy tudásasszisztens, amely egyszerre pontos és auditálható – két tulajdonság, amelyek rendkívül fontosak a szabályozott iparágakban.

RAG-folyamat diagram, amely a beömlesztési, darabolási, beágyazási, vektoros indexelési, visszakeresési és generálási lépéseket mutatja
A teljes RAG-folyamat: a nyers dokumentumoktól a megalapozott, idézett válaszig.

A RAG-folyamat lépésről lépésre

Egy éles RAG-rendszer hat szakaszból áll. Mindegyik megértése segít elkerülni a leggyakoribb hibákat.

  • Beömlesztés: dokumentumok betöltése PDF-ekből, Word-fájlokból, Confluence-oldalakból, SharePointból vagy bármely strukturált forrásból, amelyet a szervezet használ.
  • Darabolás: dokumentumok szegmensekre osztása – jellemzően 200-500 token –, amelyek elég kicsik ahhoz, hogy beleferjenek a modell kontextusablakába, de elég nagyok ahhoz, hogy értelmet hordozzanak.
  • Beágyazás: minden egyes szelet sűrű vektorrá alakítása helyi beágyazási modellel, például BGE-M3-mal vagy E5-multilingualisszel. Nincs szükség felhőhívásra.
  • Vektoros index: beágyazások tárolása egy vektoros adatbázisban (Qdrant, Chroma, pgvector), amely a saját infrastruktúráján fut.
  • Visszakeresés: lekérdezési időben a felhasználói kérdés beágyazása, majd a legjobb k számú szelet megkeresése koszinusz-hasonlóság alapján, opcionálisan kombinálva BM25-kulcsszavas kereséssel (hibrid visszakeresés).
  • Generálás: a visszakeresett szeleteket és a kérdést átengedve az on-premise LLM-nek (Llama 3, Mistral, Qwen vagy más nyílt súlyú modell, amelyet Ollama vagy vLLM kiszolgál), idézett választ állít elő.

Privátság megőrzése a Privonis-szal

A folyamat minden lépése az infrastruktúráján belül fut, ha a Privonis-szal telepít. A beágyazási modell, a vektoros adatbázis, az LLM-következtetési szerver és a vezénylési réteg mind saját üzemeltetésű. A dokumentumok soha nem hagyják el a hálózatát. Ez nem csupán adatvédelmi preferencia – a GDPR, a NIS2 irányelv vagy a pénzügyi és egészségügyi ágazat-specifikus szabályok hatálya alá eső vállalatok számára az adatok helyszínen tartása gyakran megfelelési követelmény, nem opció.

Pajzs ikon, amely az on-premise adatvédelmet és szuverenitást jelképezi
Az on-premise telepítés azt jelenti, hogy adatai soha nem érintkeznek külső szerverekkel.

Darabolási és visszakeresési minőségi tippek

A RAG-rendszer minőségét a darabolási és visszakeresési szakaszok döntik el. Néhány következetesen javuló eredményt hozó gyakorlat: ahol lehetséges, használjon szemantikai darabolást fix tokenszámok helyett; 10-15%-kal fedjük át a szeleteket a határon való kontextusvágás elkerülése érdekében; tárolja a dokumentum metaadatait (forrás, dátum, szakasz fejléce) minden szelet mellett, hogy a modell pontosan tudjon idézni; és kísérletezzen a visszakeresett részletek cross-encoder modellel való újrarendezésével, mielőtt a generátorhoz küldené.

A válasz csak annyira jó, mint a visszakeresés. Fektessen be a darabolási stratégiába és a hibrid keresésbe, mielőtt egy nagyobb modellbe fektetne.

A tudásasszisztens értékelése

Az értékelést a korai RAG-projekteknél gyakran kihagyják, és később megbánják. Készítsen egy arany adatkészletet 50-100 kérdés-felelet párból, amelyeket szaktudással rendelkező szakértők adnak meg. Mérje a visszakeresési visszahívást (megjelent-e a helyes szelet a legjobb k eredményben?), a válasz hitelességét (ragaszkodik-e a válasz ahhoz, amit a visszakeresett szöveg mond?) és a válasz relevanciáját (valóban megválaszolja a kérdést?). A nyílt forráskódú keretrendszerek, mint a RAGAS vagy a DeepEval, automatizálhatják ennek a pontozásnak nagy részét, és integrálhatók egy CI-folyamatba, hogy a visszaeséseket az üzembe helyezés előtt észleljük.

Elkerülendő gyakori buktatók

A leggyakoribb hibák, amelyeket a tudásasszisztensek építésében segítő vállalatoknál látunk: alacsony minőségű vagy duplikált dokumentumok beágyazása megtisztítás nélkül; túl nagy szeletméret kiválasztása, amely miatt a modell nem találja azt a konkrét mondatot, amely megválaszolja a kérdést; a többnyelvű dokumentumok figyelmen kívül hagyása (a BGE-M3 és az E5-multilingual jól kezeli a vegyes nyelvű korpuszokat); és hozzáférés-ellenőrzések kihagyása, amely miatt az egyik osztály felhasználója olyan dokumentumokat kereshet vissza, amelyeket nem kellene látnia. A Privonis-telepítések tartalmazzák a szerepkör-alapú gyűjtemény-particionálást az utóbbi pont kezelésére. Építse fel helyesen az elejétől, és privát tudásasszisztense a szervezet valaha telepített leghasznosabb eszközei egyike lesz.

Beszéljünk az Ön MI-projektjéről

Időpont foglalása