Quantization u inferenza mgħaġġla fuq l-hardware proprju tiegħek
Kif tgħaqqad mudelli akbar fuq GPUs iżgħar u sservihom malajr.
L-ewwel reazzjoni li ħafna nġiniera jkollhom meta jħarsu lejn ir-rekwiżiti tal-hardware għal mudell ta' lingwa kbira tal-ogħla livell hija xokk tal-prezz. Mudell ta' 70 biljun parametru fil-format FP32 nattiv tiegħu kien jeħtieġ madwar 280 GB ta' memorja GPU — aktar milli ħafna organizzazzjonijiet għandhom f'server wieħed, u ħafna iżjed milli jridu jipprovdu sempliċement biex iwieġbu l-mistoqsijiet tal-impjegati. Il-quantization hija t-teknika li tagħmel dawn in-numri trattabbli, u l-fehim tagħha huwa essenzjali għal kull min jiddisinja stakk tal-AI on-premise.
X'tagħmel fil-fatt il-quantization
Netwerk newrali huwa fl-aħħar mill-aħħar ġabra kbira ħafna ta' numri — il-piżi mgħallma waqt it-taħriġ. B'mod awtomatiku dawk il-piżi jinħażnu bħala valuri floating-point ta' 32-bit (FP32), kull wieħed jikkonsmaw 4 bytes ta' memorja. Il-quantization tissostitwixxi n-numri ta' preċiżjoni għolja b'rappreżentazzjonijiet ta' preċiżjoni inqas: floats ta' 16-bit (FP16 jew BF16), integers ta' 8-bit (INT8) jew saħansitra integers ta' 4-bit (INT4). Il-footprint tal-memorja jitnaqqas b'mod proporzjonali, u fuq hardware b'appoġġ nattiv għall-aritmetika ta' preċiżjoni inqas, l-inferenza wkoll issir aktar mgħaġġla.
- FP16 / BF16 — floats ta' nofs il-preċiżjoni. Kważi bla telf għall-biċċa l-kbira tal-kompiti; l-għażla ewlenija għal deployments ta' produzzjoni fejn il-preċiżjoni hija kritika. Iffrankar tal-memorja: 2x vs FP32.
- INT8 — integers ta' 8-bit, tipikament prodotti minn metodi ta' post-training quantization (PTQ) bħal GPTQ jew llm.int8(). Degradazzoni modesta tal-kwalità fuq raġunament kumpless; sinifikanti fuq il-biċċa l-kbira tal-kompiti prattiċi. Iffrankar tal-memorja: 4x vs FP32.
- INT4 — integers ta' 4-bit, il-fruntiera tal-quantization aggressiva. Għodod bħal GGUF Q4_K_M u AWQ iwasslu kwalità sorprendentement tajba għad-daqs tagħhom. Iffrankar tal-memorja: 8x vs FP32, b'degradazzoni aċċettabbli għal workloads ta' chat u sommarju.
Il-kompromess tal-kwalità vs id-daqs
Il-quantization mhix bla ħlas. Kull bit li tneħħi huwa informazzoni mitlufa, u f'xi punt dan jidher bħala output degradat — alluċinazzjonijiet, żbalji tar-raġunament jew telf tan-newans. Is-sejba prattika mid-deployments ta' Privonis hija li l-kompromess huwa sorprendentement favorevoli għall-biċċa l-kbira tal-kompiti tal-intrapriżi. Mudell ta' 70B quantized għal INT4 tipikament jegħleb mudell ta' 13B fuq FP16, anke jekk iż-żewġ jidħlu f'memorja GPU simili. Għal kull dubju, uża l-mudell l-akbar li jidħol fl-aktar preċiżjoni għolja li l-hardware tiegħek jappoġġja.
L-għażla tal-quantization it-tajba hija inqas dwar in-numru tal-bits u aktar dwar it-tqabbil tal-kapaċità tal-mudell mal-kompitu: INT4 70B magħżul sew jegħleb FP16 13B negliġenti kull darba.
Servers tal-inferenza: minn fejn ġej ir-rendiment
It-tħaddim ta' mudell quantized huwa nofs il-kwistjoni biss. Is-servizz tiegħu b'effiċjenza taħt tagħbija simultanja jeħtieġ server tal-inferenza li jifhem l-istruttura tal-attenzjoni tat-transformer. L-opzjoni open-source dominanti llum hija vLLM, li introduċiet PagedAttention — teknika ta' ġestjoni tal-memorja mislufa mill-memorja virtwali tas-sistema operattiva li tippermetti lis-server jinterfroda ħafna talbiet simultanjament mingħajr ma jaħli memorja GPU fuq blokki tal-cache KV pre-allokati. L-effett prattiku huwa titjib ta' 10–30x fir-rendiment fuq loop naiv ta' talba waħda.
Opzjonijiet notevoli oħra jinkludu llama.cpp (favorevoli għall-CPU, eċċellenti għal mudelli iżgħar fuq hardware tal-kummerċ), Ollama (wrapper favorevoli għall-iżviluppatur madwar llama.cpp), TGI minn Hugging Face (appoġġ qawwi għal formati tal-mudell ta' Hugging Face) u TensorRT-LLM minn NVIDIA (l-ogħla rendiment fuq hardware ta' NVIDIA, bl-ispiża ta' pipeline ta' kompilazzoni aktar kumpless). Privonis tevalwa u tibbenċmarka dawn kollha għal kull konfigurazzoni tal-klijent.
Batching u rendiment
Il-GPUs jiksbu effiċjenza massima meta jipproċessaw ħafna operazzjonijiet simultanjament — dan huwa l-iskop għalih ġew iddisinjati. Il-batching kontinwu (imsejjaħ ukoll batching dinamiku jew sskedi fil-livell tal-iterazzoni) jippermetti lil server tal-inferenza jgħaqqad tokens minn talbiet simultanji multipli f'sejħa waħda tal-kernel GPU, u jtejjeb b'mod drammatiku l-utilizzazzoni. Mingħajr batching, query ta' utent wieħed jista' juża 5% tal-kapaċità tal-GPU tiegħek; bil-batching kontinwu, tista' timbotta l-utilizzazzoni għal 70–80% taħt mudelli tat-traffiku fid-dinja reali. Għal intrapriża b'għadd ta' utenti simultanji, id-differenza bejn server konxju tal-batching u wieħed naiv tista' tfisser il-bżonn ta' server GPU wieħed jew erbgħa.
Tagħżel il-quantization it-tajba għall-GPU tiegħek
Is-siġra tad-deċiżjoni hija aktar sempliċi milli tidher. Ibda bil-baġit tal-memorja GPU tiegħek, naqqas spazju għas-OS u s-server tal-inferenza (tipikament 4–8 GB), imbagħad sib il-mudell l-akbar li jidħol fil-livell l-aktar għoli ta' preċiżjoni. Ftit punti ta' referenza prattiċi:
- 24 GB VRAM (eż. RTX 4090, A5000) — jħaddem komfortevolment mudell ta' 13B fuq FP16, jew mudell ta' 34B fuq INT4.
- 48 GB VRAM (eż. RTX 6000 Ada, A6000) — jħaddem mudell ta' 34B fuq FP16, jew mudell ta' 70B fuq INT4.
- 2 × 80 GB (eż. par A100 permezz ta' NVLink) — jħaddem mudell ta' 70B fuq FP16, jew mudell ta' 140B fuq INT4 bil-paralleliżmu tat-tensuri.
- CPU biss (mingħajr GPU) — llama.cpp b'mudell Q4_K_M 7B jew 13B huwa fattibbli għal għodod tal-iżviluppatur ta' konkorrenza baxxa; stenna 5–15 tokens/s.
Tgħaqqadu flimkien ma' Privonis
L-għażla ta' format ta' quantization u server tal-inferenza hija xogħol tal-inġinerija li jeħtieġ profiling fuq l-hardware speċifiku tiegħek bil-workload speċifiku tiegħek. Privonis jittratta dak il-benċmarkjar bħala parti minn kull deployment: naħdmu testijiet tar-rendiment, inkejlu l-kwalità tal-output fuq kampjun rappreżentattiv tal-prompts reali tiegħek, u nwasslu konfigurazzoni li timmassimizza l-prestazzjoni fil-baġit tal-hardware tiegħek. Ir-riżultat huwa stakk ta' inferenza tal-produzzjoni li t-tim tiegħek jista' jopera mingħajr inġinier ML speċjalizzat fuq sejħa. Jekk inti lest biex tesplora dak li jgħodd għall-ambjent tiegħek, it-tim tagħna huwa kuntent li jħaddem in-numri miegħek.
Nitkellmu dwar il-proġett AI tiegħek
Ibbukkja telefonata