Helyi AI 7 perc olvasás

Helyi AI hardverigény: mekkora VRAM kell?

A saját szerveren futó AI legdrágább döntése a hardver, és a legtöbben túlméretezik. Ez az írás megmutatja, mi szab valójában határt, és mennyivel lehet megúszni.

Közzétéve:

A VRAM a szűk keresztmetszet, nem a processzor

Egy nyelvi modell futtatásakor a modell súlyainak be kell férniük a memóriába, és a gyakorlatban ez a videokártya memóriáját jelenti. Ha nem fér be, a rendszer a rendszermemóriába kényszerül átlapolni, és a sebesség nagyságrendekkel esik — a másodpercenként több tíz szóból másodpercenként néhány szó lesz.

Ezért a hardvertervezés első kérdése mindig ugyanaz: hány gigabájt VRAM áll rendelkezésre, és mekkora az a legnagyobb modell, amely ebbe kényelmesen belefér. A processzor és a rendszermemória ehhez képest másodlagos.

Kvantálás: ezért fér be a modell

A modellek eredetileg 16 bites lebegőpontos számokkal dolgoznak. A kvantálás ezt a pontosságot csökkenti — jellemzően 8 vagy 4 bitre —, ami nagyjából felére, illetve negyedére csökkenti a memóriaigényt.

A kézenfekvő kérdés, hogy mennyit veszít ezzel a modell. Négybites kvantálásnál a legtöbb üzleti feladatnál — összefoglalás, dokumentumkeresés, e-mail-fogalmazás, osztályozás — a különbség alig érzékelhető. Nyolcbitesnél gyakorlatilag nem mérhető. A négybites változat ma a bevett alapértelmezés, és a lenti számok is erre vonatkoznak.

Modellméret és VRAM: nagyságrendek

Négybites kvantálással, egyetlen felhasználót feltételezve, körülbelül a következőkkel érdemes számolni. A pontos érték modellcsaládonként néhány százalékkal eltér, de a nagyságrend tervezéshez használható:

  • 7–8 milliárd paraméter: 6–8 GB VRAM. Egy 12 GB-os kártyán kényelmesen elfut. Ide tartozik a legtöbb kisebb nyílt modell.
  • 12–14 milliárd: 10–12 GB. Egy 16 GB-os kártya jó választás hozzá.
  • 27–32 milliárd: 20–24 GB. Itt már 24 GB-os kártya kell, és ez a legjobb ár-érték arányú belépő a komolyabb feladatokhoz.
  • 70 milliárd: 40–48 GB. Ez vagy egy nagy, dedikált gyorsító, vagy két kártya összekapcsolása — jelentős árugrás.
Videomemória-igény modellméret szerint Négybites kvantálással, egyetlen felhasználót feltételezve. A halvány sáv a minimum, a telített rész a felső becslés. A 70 milliárdos kategória az, ahol a hardver ára ugrik. 0 GB 12 GB 24 GB 36 GB 48 GB 7–8 milliárd paraméter 12 GB-os kártya bőven elég 6–8 GB 12–14 milliárd 16 GB-os kártya 10–12 GB 27–32 milliárd 24 GB-os kártya 20–24 GB 70 milliárd több kártya vagy gyorsító 40–48 GB
Négybites kvantálással, egyetlen felhasználót feltételezve. A halvány sáv a minimum, a telített rész a felső becslés. A 70 milliárdos kategória az, ahol a hardver ára ugrik.

Amiről gyakran megfeledkeznek: a kontextus és a párhuzamosság

A modell súlyai mellett a beszélgetés kontextusa is memóriát foglal, és ez hosszú dokumentumoknál nem elhanyagolható. Egy több tízezer szavas szerződés feldolgozásakor a kontextus több gigabájtot is elvihet a súlyokon felül — ezért érdemes a fenti számokhoz néhány gigabájt tartalékot tervezni.

A másik gyakori tévedés a párhuzamos használat. Egy modell egy példánya egyszerre több kérést is kiszolgál, de a kontextusuk összeadódik. Öt-tíz párhuzamos belső felhasználónál ez általában még belefér egy nagyobb kártyába; ötven egyidejű ügyfélbeszélgetésnél már kapacitástervezés kell, nem tapasztalati szabály.

Reális gépajánlások felhasználás szerint

A gyakorlatban a legtöbb magyar KKV-feladat sokkal kisebb hardveren elfut, mint amire számítani szoktak:

  • Belső dokumentumkereső néhány felhasználóval: 8–14 milliárd paraméteres modell, 16 GB VRAM. Ez egy erősebb munkaállomás kategóriája, nem szerverberuházás.
  • Osztályozás, összefoglalás, e-mail-előkészítés: ugyanez a kategória bőven elég; ezek a feladatok nem igényelnek nagy modellt.
  • Összetettebb elemzés, hosszú szerződések, igényesebb magyar szöveg: 27–32 milliárdos modell, 24 GB VRAM.
  • Sok párhuzamos felhasználó vagy ügyfél felé nyitott szolgáltatás: dedikált GPU-szerver, mérésen alapuló kapacitástervezéssel.

Mikor olcsóbb mégis a felhő

Ha a használat ritka és kiszámíthatatlan, egy használatarányos felhőszolgáltatás olcsóbb, mint egy folyamatosan amortizálódó videokártya. A helyi telepítés akkor éri meg, ha rendszeres a terhelés, vagy ha az adatvédelem miatt egyszerűen nincs más lehetőség — ügyvédi, egészségügyi, könyvelési és HR-adatoknál gyakran ez a helyzet.

A döntéshez érdemes néhány hétig mérni a tényleges használatot egy felhős megoldáson, és a valós számokból számolni. Erről bővebben a helyi AI rendszerek oldalon írunk.

Nézzük meg a konkrét igényét

Felmérjük a feladatot és a meglévő hardvert, majd megmondjuk, mi elég hozzá — és mi a felesleges költés.