Pereiti prie turinio
← Atgal į tinklaraštį
Programos 2026 m. gegužės 25 d. · 7 min skaitymas

Sukurkite privatų žinių asistentą su RAG

Paversite savo dokumentus privačiu asistentu, atsakančiu su nuorodomis – neišsiunčiant nieko į debesį.

Sukurkite privatų žinių asistentą su RAG

Įsivaizduokite, kad užduodate klausimą ir gaunate atsakymą, cituojantį tikslų paragrafą iš jūsų vidaus politikos, produkto specifikacijos ar praėjusio ketvirčio audito ataskaitos – visa tai be vieno baito paliekant jūsų serverio kambarį. Tai yra paieška papildytos generacijos (RAG) pažadas, ir su Privonis, veikiančia visiškai vietoje, tai dabar pasiekiama bet kuriai Europos įmonei, kuri rimtai žiūri į duomenų suverenumą.

Kas yra RAG ir kodėl tai svarbu?

Dideli kalbos modeliai yra galingi samprotautojai, tačiau jie žino tik tai, kuo buvo apmokyti. RAG tai ištaiso, užklauso metu gaudamas atitinkamas ištraukas iš jūsų nuosavų dokumentų ir pateikdamas jas modeliui kaip kontekstą. Tada modelis atsako remdamasis tais fragmentais, cituodamas šaltinius, o ne sukurdamas faktus. Rezultatas yra žinių asistentas, kuris yra ir tikslus, ir audituojamas – dvi savybės, kurios yra nepaprastai svarbios reguliuojamuose sektoriuose.

RAG konvejerio diagrama, rodanti įkėlimo, skaidymo, įterpimo, vektorinio indekso, gavimo ir generavimo etapus
Pilnas RAG konvejeris: nuo neapdorotų dokumentų iki pagrįsto, cituoto atsakymo.

RAG konvejeris žingsnis po žingsnio

Gamybos RAG sistema apima šešis etapus. Supratimas apie kiekvieną padeda išvengti dažniausių nesėkmių.

  • Įkėlimas: įkelkite dokumentus iš PDF, Word failų, Confluence puslapių, SharePoint ar bet kokio struktūrizuoto šaltinio, kurį naudoja jūsų organizacija.
  • Skaidymas: skaidykite dokumentus į segmentus – paprastai 200–500 žetonų – pakankamai mažus, kad tilptų modelio konteksto lange, bet pakankamai didelius, kad neštų prasmę.
  • Įterpimas: kiekvieną fragmentą konvertuokite į tankų vektorių naudodami vietinį įterpimo modelį, pvz., BGE-M3 arba E5-multilingual. Nereikia debesų kvietimo.
  • Vektorių indeksas: saugokite įterptus duomenis vektorių duomenų bazėje (Qdrant, Chroma, pgvector), veikiančioje jūsų pačių infrastruktūroje.
  • Gavimas: užklausos metu įterpkite vartotojo klausimą ir raskite k artimiausius fragmentus pagal kosinuso panašumą, pasirinktinai derinant su BM25 raktinių žodžių paieška (hibridinė paieška).
  • Generavimas: perduokite gautus fragmentus ir klausimą į jūsų vietinį LLM (Llama 3, Mistral, Qwen ar kitą atvirojo kodo modelį, serveriuojamą per Ollama arba vLLM) ir sugeneruokite cituotą atsakymą.

Privatumo išsaugojimas su Privonis

Kiekvienas šio konvejerio žingsnis veikia jūsų infrastruktūros ribose, kai diegiate su Privonis. Įterpimo modelis, vektorių duomenų bazė, LLM išvadų serveris ir orkestravimo sluoksnis yra visi patalpinti pačių. Jūsų dokumentai niekada nepalieka jūsų tinklo. Tai nėra tik privatumo nuostata – įmonėms, kurioms taikomas GDPR, NIS2 direktyva arba sektoriaus specifinės finansų ir sveikatos priežiūros taisyklės, duomenų laikymas vietoje dažnai yra atitikties reikalavimas, o ne galimybė.

Skydo piktograma, atstovaujanti vietinę duomenų apsaugą ir suverenumą
Vietinis diegimas reiškia, kad jūsų duomenys niekada neliečia išorinių serverių.

Skaidymo ir gavimo kokybės patarimai

Jūsų RAG sistemos kokybė priklauso arba nesėkmingai baigiasi skaidymo ir gavimo etapuose. Keletas praktikų, kurios nuolat gerina rezultatus: kur įmanoma, naudokite semantinį skaidymą, o ne fiksuotus žetonų skaičius; sutampinkite fragmentus 10–15 %, kad išvengtumėte konteksto kirpimo prie ribų; kartu su kiekvienu fragmentu saugokite dokumento metaduomenis (šaltinis, data, skyriaus antraštė), kad modelis galėtų tiksliai cituoti; ir eksperimentuokite su gautų fragmentų perrangavimu kryžminio kodavimo modeliu prieš siunčiant juos generatoriui.

Atsakymas yra toks geras, koks yra gavimas. Investuokite į skaidymo strategiją ir hibridinę paiešką prieš investuojant į didesnį modelį.

Žinių asistento vertinimas

Vertinimas dažnai praleidžiamas ankstyvuosiuose RAG projektuose ir vėliau apgailestaujama. Sukurkite auksinį 50–100 klausimų-atsakymų porų rinkinį iš srities ekspertų. Matuokite gavimo atkūrimą (ar tinkamas fragmentas pasirodė k geriausių rezultatų sąraše?), atsakymo ištikimybę (ar atsakymas laikosi to, ką sako gautas tekstas?) ir atsakymo aktualumą (ar jis iš tikrųjų sprendžia klausimą?). Atvirojo kodo sistemos kaip RAGAS arba DeepEval gali automatizuoti didelę dalį šio vertinimo ir integruotis į CI konvejerį, kad regresijai būtų aptiktos prieš diegimą.

Dažniausios klaidos, kurių reikia vengti

Dažniausios klaidos, kurias matome padėdami įmonėms kurti žinių asistentus: žemos kokybės ar pasikartojančių dokumentų įterpimas neišvalius jų pirmiausia; per didelio fragmento dydžio pasirinkimas, dėl kurio modelis praleidžia konkrečiai į klausimą atsakančią eilutę; daugiakalbių dokumentų ignoravimas (BGE-M3 ir E5-multilingual gerai tvarko mišrios kalbos korpusus); ir prieigos kontrolių praleidimas, dėl kurių vieno skyriaus vartotojas gali gauti dokumentus, kurių neturėtų matyti. Privonis diegimai apima vaidmenimis pagrįstą kolekcijų skaidymą iš karto, siekiant spręsti paskutinį punktą. Sukurkite teisingai nuo pat pradžių ir jūsų privatus žinių asistentas bus viena iš vertingiausių priemonių, kurias jūsų organizacija kada nors diegė.

Pakalbėkime apie jūsų AI projektą

Rezervuoti skambutį