Helyi AI 7 perc olvasás
Helyi AI hardverigény: mekkora VRAM kell?
A saját szerveren futó AI legdrágább döntése a hardver, és a legtöbben túlméretezik. Ez az írás megmutatja, mi szab valójában határt, és mennyivel lehet megúszni.
Közzétéve:
A VRAM a szűk keresztmetszet, nem a processzor
Egy nyelvi modell futtatásakor a modell súlyainak be kell férniük a memóriába, és a gyakorlatban ez a videokártya memóriáját jelenti. Ha nem fér be, a rendszer a rendszermemóriába kényszerül átlapolni, és a sebesség nagyságrendekkel esik — a másodpercenként több tíz szóból másodpercenként néhány szó lesz.
Ezért a hardvertervezés első kérdése mindig ugyanaz: hány gigabájt VRAM áll rendelkezésre, és mekkora az a legnagyobb modell, amely ebbe kényelmesen belefér. A processzor és a rendszermemória ehhez képest másodlagos.
Kvantálás: ezért fér be a modell
A modellek eredetileg 16 bites lebegőpontos számokkal dolgoznak. A kvantálás ezt a pontosságot csökkenti — jellemzően 8 vagy 4 bitre —, ami nagyjából felére, illetve negyedére csökkenti a memóriaigényt.
A kézenfekvő kérdés, hogy mennyit veszít ezzel a modell. Négybites kvantálásnál a legtöbb üzleti feladatnál — összefoglalás, dokumentumkeresés, e-mail-fogalmazás, osztályozás — a különbség alig érzékelhető. Nyolcbitesnél gyakorlatilag nem mérhető. A négybites változat ma a bevett alapértelmezés, és a lenti számok is erre vonatkoznak.
Modellméret és VRAM: nagyságrendek
Négybites kvantálással, egyetlen felhasználót feltételezve, körülbelül a következőkkel érdemes számolni. A pontos érték modellcsaládonként néhány százalékkal eltér, de a nagyságrend tervezéshez használható:
- 7–8 milliárd paraméter: 6–8 GB VRAM. Egy 12 GB-os kártyán kényelmesen elfut. Ide tartozik a legtöbb kisebb nyílt modell.
- 12–14 milliárd: 10–12 GB. Egy 16 GB-os kártya jó választás hozzá.
- 27–32 milliárd: 20–24 GB. Itt már 24 GB-os kártya kell, és ez a legjobb ár-érték arányú belépő a komolyabb feladatokhoz.
- 70 milliárd: 40–48 GB. Ez vagy egy nagy, dedikált gyorsító, vagy két kártya összekapcsolása — jelentős árugrás.
Amiről gyakran megfeledkeznek: a kontextus és a párhuzamosság
A modell súlyai mellett a beszélgetés kontextusa is memóriát foglal, és ez hosszú dokumentumoknál nem elhanyagolható. Egy több tízezer szavas szerződés feldolgozásakor a kontextus több gigabájtot is elvihet a súlyokon felül — ezért érdemes a fenti számokhoz néhány gigabájt tartalékot tervezni.
A másik gyakori tévedés a párhuzamos használat. Egy modell egy példánya egyszerre több kérést is kiszolgál, de a kontextusuk összeadódik. Öt-tíz párhuzamos belső felhasználónál ez általában még belefér egy nagyobb kártyába; ötven egyidejű ügyfélbeszélgetésnél már kapacitástervezés kell, nem tapasztalati szabály.
Reális gépajánlások felhasználás szerint
A gyakorlatban a legtöbb magyar KKV-feladat sokkal kisebb hardveren elfut, mint amire számítani szoktak:
- Belső dokumentumkereső néhány felhasználóval: 8–14 milliárd paraméteres modell, 16 GB VRAM. Ez egy erősebb munkaállomás kategóriája, nem szerverberuházás.
- Osztályozás, összefoglalás, e-mail-előkészítés: ugyanez a kategória bőven elég; ezek a feladatok nem igényelnek nagy modellt.
- Összetettebb elemzés, hosszú szerződések, igényesebb magyar szöveg: 27–32 milliárdos modell, 24 GB VRAM.
- Sok párhuzamos felhasználó vagy ügyfél felé nyitott szolgáltatás: dedikált GPU-szerver, mérésen alapuló kapacitástervezéssel.
Mikor olcsóbb mégis a felhő
Ha a használat ritka és kiszámíthatatlan, egy használatarányos felhőszolgáltatás olcsóbb, mint egy folyamatosan amortizálódó videokártya. A helyi telepítés akkor éri meg, ha rendszeres a terhelés, vagy ha az adatvédelem miatt egyszerűen nincs más lehetőség — ügyvédi, egészségügyi, könyvelési és HR-adatoknál gyakran ez a helyzet.
A döntéshez érdemes néhány hétig mérni a tényleges használatot egy felhős megoldáson, és a valós számokból számolni. Erről bővebben a helyi AI rendszerek oldalon írunk.
Nézzük meg a konkrét igényét
Felmérjük a feladatot és a meglévő hardvert, majd megmondjuk, mi elég hozzá — és mi a felesleges költés.