Mur għall-kontenut
← Lura għall-blog
Teknoloġija 16 ta’ April 2026 · 7 min qari

Quantization u inferenza mgħaġġla fuq l-hardware proprju tiegħek

Kif tgħaqqad mudelli akbar fuq GPUs iżgħar u sservihom malajr.

Quantization u inferenza mgħaġġla fuq l-hardware proprju tiegħek

L-ewwel reazzjoni li ħafna nġiniera jkollhom meta jħarsu lejn ir-rekwiżiti tal-hardware għal mudell ta' lingwa kbira tal-ogħla livell hija xokk tal-prezz. Mudell ta' 70 biljun parametru fil-format FP32 nattiv tiegħu kien jeħtieġ madwar 280 GB ta' memorja GPU — aktar milli ħafna organizzazzjonijiet għandhom f'server wieħed, u ħafna iżjed milli jridu jipprovdu sempliċement biex iwieġbu l-mistoqsijiet tal-impjegati. Il-quantization hija t-teknika li tagħmel dawn in-numri trattabbli, u l-fehim tagħha huwa essenzjali għal kull min jiddisinja stakk tal-AI on-premise.

X'tagħmel fil-fatt il-quantization

Netwerk newrali huwa fl-aħħar mill-aħħar ġabra kbira ħafna ta' numri — il-piżi mgħallma waqt it-taħriġ. B'mod awtomatiku dawk il-piżi jinħażnu bħala valuri floating-point ta' 32-bit (FP32), kull wieħed jikkonsmaw 4 bytes ta' memorja. Il-quantization tissostitwixxi n-numri ta' preċiżjoni għolja b'rappreżentazzjonijiet ta' preċiżjoni inqas: floats ta' 16-bit (FP16 jew BF16), integers ta' 8-bit (INT8) jew saħansitra integers ta' 4-bit (INT4). Il-footprint tal-memorja jitnaqqas b'mod proporzjonali, u fuq hardware b'appoġġ nattiv għall-aritmetika ta' preċiżjoni inqas, l-inferenza wkoll issir aktar mgħaġġla.

  • FP16 / BF16 — floats ta' nofs il-preċiżjoni. Kważi bla telf għall-biċċa l-kbira tal-kompiti; l-għażla ewlenija għal deployments ta' produzzjoni fejn il-preċiżjoni hija kritika. Iffrankar tal-memorja: 2x vs FP32.
  • INT8 — integers ta' 8-bit, tipikament prodotti minn metodi ta' post-training quantization (PTQ) bħal GPTQ jew llm.int8(). Degradazzoni modesta tal-kwalità fuq raġunament kumpless; sinifikanti fuq il-biċċa l-kbira tal-kompiti prattiċi. Iffrankar tal-memorja: 4x vs FP32.
  • INT4 — integers ta' 4-bit, il-fruntiera tal-quantization aggressiva. Għodod bħal GGUF Q4_K_M u AWQ iwasslu kwalità sorprendentement tajba għad-daqs tagħhom. Iffrankar tal-memorja: 8x vs FP32, b'degradazzoni aċċettabbli għal workloads ta' chat u sommarju.

Il-kompromess tal-kwalità vs id-daqs

Il-quantization mhix bla ħlas. Kull bit li tneħħi huwa informazzoni mitlufa, u f'xi punt dan jidher bħala output degradat — alluċinazzjonijiet, żbalji tar-raġunament jew telf tan-newans. Is-sejba prattika mid-deployments ta' Privonis hija li l-kompromess huwa sorprendentement favorevoli għall-biċċa l-kbira tal-kompiti tal-intrapriżi. Mudell ta' 70B quantized għal INT4 tipikament jegħleb mudell ta' 13B fuq FP16, anke jekk iż-żewġ jidħlu f'memorja GPU simili. Għal kull dubju, uża l-mudell l-akbar li jidħol fl-aktar preċiżjoni għolja li l-hardware tiegħek jappoġġja.

Tqabbil tal-użu tal-memorja GPU madwar livelli ta' quantization għal mudell ta' 70B parametri
Rekwiżiti tal-memorja għal mudell ta' 70B f'livelli differenti ta' preċiżjoni — INT4 jagħmlu possibbli li jħaddem fuq GPU ta' workstation ta' grad għoli wieħed.
L-għażla tal-quantization it-tajba hija inqas dwar in-numru tal-bits u aktar dwar it-tqabbil tal-kapaċità tal-mudell mal-kompitu: INT4 70B magħżul sew jegħleb FP16 13B negliġenti kull darba.

Servers tal-inferenza: minn fejn ġej ir-rendiment

It-tħaddim ta' mudell quantized huwa nofs il-kwistjoni biss. Is-servizz tiegħu b'effiċjenza taħt tagħbija simultanja jeħtieġ server tal-inferenza li jifhem l-istruttura tal-attenzjoni tat-transformer. L-opzjoni open-source dominanti llum hija vLLM, li introduċiet PagedAttention — teknika ta' ġestjoni tal-memorja mislufa mill-memorja virtwali tas-sistema operattiva li tippermetti lis-server jinterfroda ħafna talbiet simultanjament mingħajr ma jaħli memorja GPU fuq blokki tal-cache KV pre-allokati. L-effett prattiku huwa titjib ta' 10–30x fir-rendiment fuq loop naiv ta' talba waħda.

Opzjonijiet notevoli oħra jinkludu llama.cpp (favorevoli għall-CPU, eċċellenti għal mudelli iżgħar fuq hardware tal-kummerċ), Ollama (wrapper favorevoli għall-iżviluppatur madwar llama.cpp), TGI minn Hugging Face (appoġġ qawwi għal formati tal-mudell ta' Hugging Face) u TensorRT-LLM minn NVIDIA (l-ogħla rendiment fuq hardware ta' NVIDIA, bl-ispiża ta' pipeline ta' kompilazzoni aktar kumpless). Privonis tevalwa u tibbenċmarka dawn kollha għal kull konfigurazzoni tal-klijent.

Batching u rendiment

Il-GPUs jiksbu effiċjenza massima meta jipproċessaw ħafna operazzjonijiet simultanjament — dan huwa l-iskop għalih ġew iddisinjati. Il-batching kontinwu (imsejjaħ ukoll batching dinamiku jew sskedi fil-livell tal-iterazzoni) jippermetti lil server tal-inferenza jgħaqqad tokens minn talbiet simultanji multipli f'sejħa waħda tal-kernel GPU, u jtejjeb b'mod drammatiku l-utilizzazzoni. Mingħajr batching, query ta' utent wieħed jista' juża 5% tal-kapaċità tal-GPU tiegħek; bil-batching kontinwu, tista' timbotta l-utilizzazzoni għal 70–80% taħt mudelli tat-traffiku fid-dinja reali. Għal intrapriża b'għadd ta' utenti simultanji, id-differenza bejn server konxju tal-batching u wieħed naiv tista' tfisser il-bżonn ta' server GPU wieħed jew erbgħa.

Spiża per token bħala funzjoni tal-utenti simultanji, tqabbil ta' inferenza ta' batching vs mingħajr batching
Il-batching kontinwu jifl il-kurva tal-ispiża per token hekk kif l-utenti simultanji jikbru — fattur kritiku fil-kalkoli TCO on-premise.

Tagħżel il-quantization it-tajba għall-GPU tiegħek

Is-siġra tad-deċiżjoni hija aktar sempliċi milli tidher. Ibda bil-baġit tal-memorja GPU tiegħek, naqqas spazju għas-OS u s-server tal-inferenza (tipikament 4–8 GB), imbagħad sib il-mudell l-akbar li jidħol fil-livell l-aktar għoli ta' preċiżjoni. Ftit punti ta' referenza prattiċi:

  • 24 GB VRAM (eż. RTX 4090, A5000) — jħaddem komfortevolment mudell ta' 13B fuq FP16, jew mudell ta' 34B fuq INT4.
  • 48 GB VRAM (eż. RTX 6000 Ada, A6000) — jħaddem mudell ta' 34B fuq FP16, jew mudell ta' 70B fuq INT4.
  • 2 × 80 GB (eż. par A100 permezz ta' NVLink) — jħaddem mudell ta' 70B fuq FP16, jew mudell ta' 140B fuq INT4 bil-paralleliżmu tat-tensuri.
  • CPU biss (mingħajr GPU) — llama.cpp b'mudell Q4_K_M 7B jew 13B huwa fattibbli għal għodod tal-iżviluppatur ta' konkorrenza baxxa; stenna 5–15 tokens/s.

Tgħaqqadu flimkien ma' Privonis

L-għażla ta' format ta' quantization u server tal-inferenza hija xogħol tal-inġinerija li jeħtieġ profiling fuq l-hardware speċifiku tiegħek bil-workload speċifiku tiegħek. Privonis jittratta dak il-benċmarkjar bħala parti minn kull deployment: naħdmu testijiet tar-rendiment, inkejlu l-kwalità tal-output fuq kampjun rappreżentattiv tal-prompts reali tiegħek, u nwasslu konfigurazzoni li timmassimizza l-prestazzjoni fil-baġit tal-hardware tiegħek. Ir-riżultat huwa stakk ta' inferenza tal-produzzjoni li t-tim tiegħek jista' jopera mingħajr inġinier ML speċjalizzat fuq sejħa. Jekk inti lest biex tesplora dak li jgħodd għall-ambjent tiegħek, it-tim tagħna huwa kuntent li jħaddem in-numri miegħek.

Nitkellmu dwar il-proġett AI tiegħek

Ibbukkja telefonata