Stacja robocza pod lokalne AI — Windows 11, Ryzen X3D i RTX

Komputer pod lokalne AI z Ryzenem 7 9800X3D i RTX 5070 Ti: BIOS, sterowniki NVIDIA, polityka Sysmem Fallback, odzyskanie VRAM i monitoring karty.

Lokalny model językowy obciąża komputer inaczej niż gra. Nie liczy się taktowanie rdzeni ani liczba klatek, tylko to, ile wolnej pamięci VRAM zostaje dla modelu i czy sterownik nie przerzuci jej po cichu do RAM-u. W tej części przygotujesz stację roboczą tak, żeby Gemma 4 12B z kontekstem 64K zmieściła się w całości na karcie — z zapasem.

BIOS: pamięć i PCIe

Zacznij od aktualizacji BIOS-u płyty głównej do najnowszej wersji z AGESA wspierającą Twój procesor. Poprawki pamięci DDR5 na platformie AM5 potrafią zmienić stabilność z dnia na dzień. Następnie ustaw:

Opcja (nazwy zależą od producenta płyty) Wartość Dlaczego
AMD EXPO Profil 1 (np. DDR5-6000 CL30) Bez niego pamięć pracuje z domyślnymi 4800 MT/s
Above 4G Decoding Enabled Wymagane przez Resizable BAR
Re-Size BAR Support Enabled / Auto Procesor ma dostęp do całej pamięci karty. W grach daje kilka procent, przy AI nie szkodzi
PCIe slot configuration (slot karty) Auto / Gen 5 Sprawdź, czy karta nie pracuje w trybie x8 przez dysk M.2 współdzielący linie
Integrated Graphics Auto lub Enabled Przyda się do sztuczki z odzyskaniem VRAM (niżej)

Dwa moduły RAM zamiast czterech. Na AM5 cztery moduły DDR5 zwykle wymuszają niższe taktowanie. 2× 32 GB to bezpieczne optimum. Model w całości w VRAM i tak nie korzysta z RAM-u podczas generowania, ale 64 GB wystarczy na IDE, przeglądarkę, kontenery i ładowanie modeli bez swapowania.

Po zapisaniu ustawień sprawdź w Windowsie Menedżer zadań → Wydajność → Pamięć: pole Szybkość powinno pokazywać 6000 MT/s.

Sterownik NVIDIA

Zainstaluj aktualny sterownik z nvidia.com lub przez aplikację NVIDIA. Wersja Studio i Game Ready działają z LM Studio identycznie. Studio dostaje rzadsze, dłużej testowane wydania, więc jeśli na tej maszynie ważniejsza jest stabilność niż najnowsze gry, wybierz ją.

Nie instaluj osobno CUDA Toolkit. LM Studio ma własne środowiska uruchomieniowe (runtime llama.cpp z CUDA) i pobiera je samo. Toolkit jest potrzebny tylko do kompilowania własnego oprogramowania.

Sprawdź, czy sterownik widzi kartę. W PowerShellu:

Okno terminala
nvidia-smi

W nagłówku zobaczysz wersję sterownika i obsługiwaną wersję CUDA, a w tabeli model karty i ilość pamięci — nieco ponad 16 000 MiB.

Najważniejsze ustawienie: Sysmem Fallback Policy

Od kilku lat sterownik NVIDIA na Windowsie ma funkcję, która przy braku VRAM po cichu przenosi część danych do RAM-u. Dla gier to ochrona przed awarią. Dla modelu językowego oznacza to spadek szybkości generowania kilka- lub kilkunastokrotnie — bez żadnego komunikatu. Rozmowa, która zaczęła się szybko, po zapełnieniu kontekstu nagle zwalnia i nie wiadomo dlaczego.

Wyłącz tę funkcję dla LM Studio:

  1. Panel sterowania NVIDIA → Ustawienia 3D → Zarządzaj ustawieniami 3D → Ustawienia programu.
  2. Dodaj → wskaż LM Studio.exe (domyślnie %LOCALAPPDATA%\Programs\LM Studio\). Jeśli nie widzisz go na liście, uruchom najpierw LM Studio.
  3. Ustaw CUDA — zasady powrotu do pamięci systemowej (CUDA — Sysmem Fallback Policy) na Preferuj brak powrotu do pamięci systemowej (Prefer No Sysmem Fallback). Polskie nazwy opcji mogą się nieco różnić między wersjami sterownika.
  4. Zastosuj.

Od teraz, gdy model z kontekstem się nie zmieści, LM Studio zgłosi błąd braku pamięci zamiast działać w zwolnionym tempie. Wiesz od razu, że trzeba zmniejszyć kontekst albo kwantyzację.

Ile VRAM zabiera Windows

Zanim załadujesz model, sprawdź, ile pamięci karty jest już zajęte:

Zużycie VRAM co 2 sekundy
nvidia-smi --query-gpu=memory.used,memory.total,utilization.gpu,temperature.gpu,power.draw --format=csv -l 2

Na świeżo uruchomionym systemie z jednym monitorem to zwykle 0,5–1 GB. Na Windowsie nvidia-smi nie pokazuje zużycia pamięci przez poszczególne procesy (tryb WDDM). Winowajców znajdziesz w Menedżerze zadań → Szczegóły. Kliknij prawym przyciskiem na nagłówek tabeli, wybierz Wybierz kolumny → Dedykowana pamięć GPU i posortuj.

Najczęstsi zjadacze VRAM:

  • Przeglądarki z akceleracją sprzętową — każda karta z wideo lub WebGL. Kilkaset MB na przeglądarkę to norma.
  • Discord, Steam, Epic — nakładki i interfejsy renderowane przez GPU.
  • Animowane tapety, nagrywanie w tle (ShadowPlay / Natychmiastowa powtórka), nakładki monitorujące.
  • Drugi i trzeci monitor, szczególnie o wysokiej rozdzielczości i odświeżaniu.

Budżet dla tej serii: model z kontekstem to około 11,5 GB. Jeśli system zajmuje mniej niż 2,5 GB, masz bezpieczny zapas.

Sztuczka: pulpit na grafice zintegrowanej

Ryzen 7 9800X3D ma wbudowany układ graficzny. Jeśli podłączysz monitor do wyjścia na płycie głównej, pulpit Windowsa renderuje się na grafice zintegrowanej, a RTX 5070 Ti ma całe 16 GB dla modelu. Gry i tak uruchomisz na karcie (Ustawienia → System → Ekran → Grafika → Wysoka wydajność), bo Windows przekaże obraz przez iGPU jak w laptopie. Kosztem jest niewielki narzut, a na monitorach z wysokim odświeżaniem możliwe ograniczenia.

To rozwiązanie dla maszyny, która w dzień jest serwerem AI. Jeśli komputer służy głównie do grania i strumieniowania z Sunshine, zostaw monitor podłączony do karty — zapas z poprzedniej sekcji w zupełności wystarczy.

Limit mocy karty (opcjonalnie)

Generowanie tokenów ogranicza głównie przepustowość pamięci, a nie moc obliczeniowa rdzeni. Obniżenie limitu mocy karty do około 70–80% zwykle zmniejsza szybkość generowania o kilka procent, a pobór prądu i hałas wyraźnie. Przetwarzanie długiego promptu (prompt processing) odczuje to bardziej, bo tam GPU liczy pełną mocą.

Limit ustawisz w MSI Afterburner (suwak Power Limit) albo z PowerShella uruchomionego jako administrator:

Limit mocy do 220 W (do restartu)
# Dozwolony zakres dla Twojej karty
nvidia-smi -q -d POWER | Select-String 'Power Limit'
nvidia-smi -pl 220

Wartość z nvidia-smi -pl obowiązuje do restartu. Do stałego ustawienia wygodniejszy jest Afterburner z opcją Apply overclocking at system startup. Zmierz różnicę samodzielnie — w następnej części LM Studio pokaże szybkość generowania (tokeny na sekundę) po każdej odpowiedzi.

Dysk na modele

Pliki modeli mają po kilka–kilkanaście gigabajtów i łatwo zapełniają dysk systemowy. Utwórz osobny katalog na szybkim dysku NVMe, np. D:\AI\models. LM Studio pozwala wskazać go w zakładce My Models (ikona folderu → Change), zanim cokolwiek pobierzesz.

Warto też dodać ten katalog do wyjątków skanowania Microsoft Defender. Skanowanie kilkunastogigabajtowego pliku przy każdym ładowaniu modelu potrafi dodać kilkanaście sekund:

PowerShell jako administrator
Add-MpPreference -ExclusionPath 'D:\AI\models'

Dodawaj wyjątek tylko dla modeli pobieranych z zaufanych źródeł (oficjalne repozytoria na Hugging Face, katalog LM Studio).

Lista kontrolna

  • BIOS zaktualizowany, EXPO włączone, RAM pracuje z 6000 MT/s
  • Resizable BAR włączony, karta w slocie x16
  • Sterownik NVIDIA aktualny, nvidia-smi widzi 16 GB
  • Sysmem Fallback Policy dla LM Studio: Prefer No Sysmem Fallback
  • W spoczynku zajęte mniej niż 2,5 GB VRAM
  • Katalog na modele na dysku NVMe

Stacja jest gotowa. W następnej części zainstalujesz LM Studio i uruchomisz Gemmę 4 12B z kontekstem 64K.