Atvirų modelių tikslinis derinimas naudojant savo duomenis
Kai raginimo nepakanka: kaip specializuoti atvirą modelį jūsų srityje – privačiai.
Dideli kalbos modeliai atvyksta iš anksto apmokyti ant didžiulių viešojo interneto daugybių. Ta platuma daro juos įspūdingai bendro tikslo – tačiau bendro tikslo nėra tas pats kaip eksperto. Kai jūsų verslui reikia modelio, suprantančio jūsų vidinę taksonomiją, rašančio jūsų stiliumi ar samprotaujančio apie nuosavybės procesus, atsiveria trys adaptacijos keliai: raginimo inžinerija, paieška papildyta generacija (RAG) ir tikslinis derinimas. Kiekvienas turi savo vietą, ir tinkamo pasirinkimas – ar tinkamo derinio – gali nulemti skirtumą tarp prototipo ir gamybos sistemos. Privonis padeda Europos organizacijoms naršyti šį pasirinkimą ir jį įvykdyti visiškai savo infrastruktūros ribose.
Trys srities adaptacijos keliai
Raginimo inžinerija nieko nekainuoja, išskyrus bandymus ir klaidas, tačiau susiduria su kieta siena: galite sutalpinti tik tiek konteksto lange, ir modelis gali tiesiog neturėti jums reikalingų srities žinių. RAG aplenkia konteksto limitą, užklauso metu gaudamas atitinkamus fragmentus iš žinių bazės ir pateikdamas juos modeliui. Tai galinga ir stebėtinai pigi, tačiau gavimo kokybė apriboja atsakymo kokybę – jei tinkamas fragmentas nerastas, modelis negali apie jį samprotauti.
Tikslinis derinimas naudoja kitokį požiūrį: jis atnaujina modelio svorius jūsų kuruotame duomenų rinkinyje, kad srities žinios taptų vidinės. Rezultatas yra modelis, atsakantis iš įsisavintos kompetencijos, o ne iš gautų ištraukų. Paprastai jis geriau veikia stiliui jautriose užduotyse, struktūrizuotoje išvestyje ir delsai jautriuose konvejeruose, kur negalite leisti papildomo gavimo kelionės. Trūkumas – kaina, tiek GPU laiku, tiek duomenų parengimu – todėl verta siekti, kai kiti du metodai pasiekė plokščią kreivę.
Kada tikslinis derinimas yra tinkamas pasirinkimas
- Jūsų išvestis turi tiksliai laikytis formato (klinikinės pastabos, teisiniai punktai, struktūrizuotas JSON), kurio raginimo šablonai negali patikimai užtikrinti.
- Modeliui nuolat trūksta srities žodyno, akronimų ar produktų pavadinimų, kurie niekada nepasirodė jo išankstinio mokymo korpuse.
- Delsos reikalavimai atmeta gavimo šuolį kiekvienai užklausai.
- Norite sutraukti sudėtingą, kelių pavyzdžių raginimą į nulio pavyzdžių elgesį dėl kainos ir greičio.
- Distiliuojate didesnį modelį į mažesnį, pigesnį, skirtas krašto ar vietiniam diegimui.
LoRA ir QLoRA: tikslinis derinimas be duomenų centro biudžeto
Visiškas tikslinis derinimas atnaujina kiekvieną modelio svorį, kas yra pernelyg brangu modeliams su dešimtimis milijardų parametrų. Žemo rango adaptacija (LoRA) tai aplenkia, įdiegdama mažas treniruojamas matricas į dėmesio sluoksnius, kol šaldinami pradiniai svoriai. Treniruojamų parametrų skaičius sumažėja 100 ar daugiau kartų, tačiau gautas modelis atitinka ar viršija visiško tikslinio derinimo kokybę daugumai užduočių. QLoRA papildo mišinį kvantavimu – užšaldytas bazinis modelis įkeliamas 4 bitų tikslumu, dramatiškai sumažinant GPU atminties reikalavimus tiek, kad septyniasdešimties milijardų parametrų modelį galima suderinti viename A100.
Su QLoRA komanda, turinti vieną A100, gali suderinti pažangų atvirą modelį per popietę – jokios debesų paskyros, jokių duomenų paliekančių pastatą.
Duomenų rengimas: lemiamas žingsnis
Modelio kokybę riboja duomenų kokybė. Prieš bet kokį mokymo paleidimą Privonis kartu su klientais kuria prižiūrimą įvesties-išvesties porų duomenų rinkinį, atstovaujantį tiksliai norimą elgesį. Tipiniai šaltiniai: peržiūrėtos klientų sąveikos, pataisyta modelio išvestis, ekspertų anotuoti dokumentai ir sintetiniai duomenys, sugeneruoti stipresnio mokytojo modelio ir tada filtruoti. Apimtis svarbesnė už įvairovę ir teisingumą – tūkstantis kruopščiai patikrintų pavyzdžių dažnai lenkia dešimt tūkstančių triukšmingų. Duomenų valymo konvejeriai tvarko dubliavimo šalinimą, ilgio apkarpymą ir formato normalizavimą prieš pradedant mokymą.
Vertinimas: žinojimas, kada baigta
Tikslinis derinimas be griežto vertinimo yra optimizavimas tamsoje. Sulaikytas vertinimo rinkinys – niekada nematomas mokymo metu – matuoja, ar modelis apibendrino ar tiesiog įsimintino. Metrikos priklauso nuo užduoties: tikslus atitikmuo ir F1 išskyrimo užduotims, ROUGE apibendrinimui, žmogaus pageidavimų įvertinimai atvirai generacijai. Privonis paleidžia automatizuotus vertinimus po kiekvienos kontrolinės stotelės ir žymi katastrofišką užmarštį – atvejus, kai modelis įgyja srities įgūdžių, bet praranda bendrą samprotavimą – įtraukdamas standartinės atskaitos taškų pavyzdį į kiekvieną vertinimo rinkinį.
Svoriai yra jūsų
Tai yra punktas, kuris dažnai prarandamas diskusijose apie debesų talpinamus tikslinio derinimo API: kai tiksliai derinate per trečiosios šalies paslaugą, gauti svoriai gali būti užrakinti to tiekėjo sistemoje. Su Privonis bazinis modelis yra atvirojo svorio, mokymo paleidimas vyksta aparatinėje įrangoje, kurią kontroliuojate, ir LoRA adapteris arba sujungtas kontrolinis taškas yra jūsų – saugoti, versijuoti ir diegti kur norite. Tai reiškia jokio tiekėjo priklausomybės, jokio mokesčio už žetoną modeliui, kurį sumokėjote treniruoti, ir jokios rizikos, kad tiekėjas pertreniruos jūsų duomenimis. Europos įmonėms, tvarkančioms jautrią informaciją, svorių laikymas nėra pageidaujamas – tai valdymo reikalavimas.
Pakalbėkime apie jūsų AI projektą
Rezervuoti skambutį