Każde zapytanie do chatbota w chmurze to Twój kod, Twoje dokumenty albo Twoje notatki wysłane na cudzy serwer. Czasem to nie problem. Ale umowa z klientem, dokumentacja medyczna czy po prostu prywatny dziennik to dane, które nie powinny opuszczać domu.
Dobra wiadomość jest taka, że w 2026 roku karta graficzna do grania wystarczy, żeby uruchomić model językowy, który pisze kod, streszcza dokumenty i wywołuje narzędzia — w całości lokalnie, bez abonamentu i bez limitów zapytań. Ten przewodnik wyjaśnia, jak to policzyć, zanim cokolwiek pobierzesz, i prowadzi do działającego agenta, który na Twoje polecenie z Telegrama sprawdzi stan homelabu.
Co da się realnie zrobić lokalnie
Uczciwie, bez marketingu:
- Tak: uzupełnianie i wyjaśnianie kodu, refaktoryzacja pojedynczych plików, pisanie skryptów, streszczanie i przeszukiwanie dokumentów, tłumaczenia, porządkowanie notatek, proste agenty wywołujące narzędzia (terminal, pliki, API).
- Z trudem: długie, wieloetapowe zadania programistyczne na dużym repozytorium. Najlepsze modele w chmurze wciąż wyraźnie wygrywają przy złożonym planowaniu.
- Nie: zastąpienie największych modeli chmurowych w najtrudniejszych zadaniach. Model mieszczący się w 16 GB VRAM ma kilkanaście miliardów parametrów, a nie kilkaset.
Rozsądna strategia: lokalnie wszystko, co dotyczy prywatnych danych i powtarzalnej pracy, chmura tylko do rzadkich, naprawdę trudnych problemów — i świadomie, bez wklejania do niej wrażliwych treści.
Ile VRAM potrzebuje lokalny LLM
Model generuje tekst token po tokenie i przy każdym tokenie odczytuje wszystkie swoje aktywne wagi. Pamięć karty graficznej (GDDR7 w RTX 5070 Ti) ma przepustowość rzędu kilkuset GB/s, zwykły RAM DDR5 — kilkadziesiąt. Dlatego model, który w całości mieści się w VRAM, działa kilka razy szybciej niż ten sam model podzielony między kartę a RAM.
W VRAM muszą zmieścić się trzy rzeczy:
- Wagi modelu — rozmiar pliku GGUF w wybranej kwantyzacji.
- KV cache — pamięć kontekstu. Rośnie liniowo z liczbą tokenów, które model „pamięta” w rozmowie.
- Bufory obliczeniowe i system — kilkaset MB na obliczenia plus to, co zajmuje pulpit Windowsa, przeglądarka z akceleracją i nakładki (zwykle 0,5–1,5 GB).
Pierwszą pozycję widać w nazwie pliku. Drugą większość poradników pomija, a to ona decyduje, czy model w ogóle się zmieści.
Rachunek KV cache — i dlaczego nie Qwen 2.5 Coder
Rozmiar KV cache na jeden token liczy się ze wzoru:
KV [bajty/token] = 2 (K i V) × warstwy z pełną uwagą × głowice KV × wymiar głowicy × bajty na elementAgent potrzebuje dużo kontekstu: prompt systemowy, opisy kilkudziesięciu narzędzi i historia rozmowy szybko przekraczają 30 tysięcy tokenów. Hermes Agent, którego używamy w tej serii, wymaga od modelu co najmniej 64K tokenów kontekstu i nie uruchomi się z mniejszym. Policzmy trzy popularne modele dla 64K (65 536 tokenów) i KV cache w FP16:
| Model | Wagi (plik) | KV na token | KV dla 64K | Razem | 16 GB? |
|---|---|---|---|---|---|
| Qwen2.5-Coder-14B, Q4_K_M | 8,99 GB | 192 KiB (48 warstw × 8 głowic × 128) | 12 GiB | ~21 GB | ✗ |
| gpt-oss-20b, MXFP4 | ~12–13 GB | 24 KiB (12 z 24 warstw pełnych × 8 × 64) | 1,5 GiB | ~14,5 GB | ✓ na styk |
| Gemma 4 12B, Q6_K | 9,79 GB | 16 KiB (8 z 48 warstw pełnych × 1 × 512) | ~1 GiB + 0,3 GiB okna | ~11,5 GB | ✓ z zapasem |
Qwen 2.5 Coder 14B to świetny model do kodu i przez długi czas był domyślnym wyborem na karty 16 GB. Ale jego architektura liczy uwagę na pełnym kontekście w każdej z 48 warstw. Przy 64K sam kontekst zajmuje więcej niż model, a do tego oficjalny GGUF ma natywnie tylko 32K. Da się go wcisnąć (kwantyzacja KV cache do 4 bitów, rozciąganie kontekstu przez YaRN), ale kosztem jakości i bez zapasu pamięci.
Nowsze modele rozwiązują to architekturą: większość warstw widzi tylko okno przesuwne (np. ostatnie 1024 tokeny), a pełny kontekst obsługuje co szósta warstwa. W Gemmie 4 12B kontekst 64K kosztuje około jednego gigabajta zamiast dwunastu.
Jaki lokalny LLM wybrać? Gemma 4 12B
Do całej serii używamy Gemmy 4 12B (Google DeepMind, licencja Apache 2.0):
- Kontekst natywnie do 256K, więc 64K dla agenta to jedna czwarta możliwości, bez rozciągania.
- Natywne wywoływanie narzędzi (function calling) — podstawa pracy agenta.
- Kod: 72% w LiveCodeBench v6 według karty modelu.
- Multimodalność: rozumie obrazy (zrzuty ekranu błędów, skany dokumentów), co przyda się przy przetwarzaniu dokumentów.
- Tryb rozumowania (thinking) do trudniejszych zadań.
W kwantyzacji Q6_K (9,79 GB) jakość jest praktycznie nieodróżnialna od pełnej precyzji, a całość z kontekstem 64K zajmuje około 11,5 GB. Na karcie 16 GB zostaje ponad 4 GB zapasu na system i dłuższe rozmowy.
Alternatywa: gpt-oss-20b (OpenAI, Apache 2.0) — model MoE z 3,6 mld aktywnych parametrów, bardzo szybki i dobry w wywoływaniu narzędzi, ale bez obsługi obrazów i z mniejszym zapasem VRAM. Sprawdzi się, jeśli Gemma okaże się za wolna w Twoich zadaniach.
Stos narzędzi
┌───────────────────────── Stacja robocza (Windows 11) ─────────────────────────┐ │ │ │ Hermes Agent ── narzędzia: terminal, pliki, przeglądarka, pamięć, cron │ │ │ │ │ │ OpenAI-compatible API (http://localhost:1234/v1) │ │ ▼ │ │ LM Studio (serwer) ── Gemma 4 12B Q6_K, 64K kontekstu ── RTX 5070 Ti 16 GB │ │ │ └────────┬───────────────────────────────────────────────┬──────────────────────┘ │ SSH (klucz z wymuszonym poleceniem) │ Telegram Bot API ▼ ▼ Proxmox / homelab: raport stanu telefon: rozmowa z agentem, (tylko do odczytu) poranne raporty- LM Studio pobiera modele, zarządza pamięcią GPU i udostępnia je przez API zgodne z OpenAI. Ma interfejs graficzny, ale też CLI
lmsdo automatyzacji. - Hermes Agent (Nous Research) to agent z własną pamięcią, kilkudziesięcioma narzędziami, harmonogramem zadań i bramką do komunikatorów. Działa natywnie na Windowsie.
- Telegram służy za interfejs z telefonu, ten sam, którego używamy do alertów z monitoringu.
Plan serii
- Stacja robocza pod lokalne AI — BIOS i pamięć dla Ryzena 9800X3D, sterowniki NVIDIA, polityka Sysmem Fallback, uwolnienie VRAM i monitoring.
- LM Studio i Gemma 4 12B — dobór kwantyzacji, kontekst 64K, flash attention, serwer API w tle i test wywoływania narzędzi.
- Hermes Agent — instalacja, bezpieczeństwo i Telegram — połączenie z LM Studio, zatwierdzanie poleceń, bramka Telegram z listą dozwolonych użytkowników.
- Hermes Agent w praktyce — codzienny raport z homelabu, pomoc przy kodzie i przetwarzanie dokumentów bez chmury.
Ile to kosztuje
Jeśli masz już kartę z 16 GB VRAM — nic poza prądem. Karta pod obciążeniem generowania pobiera zwykle mniej niż w grach, bo generowanie tokenów ogranicza przepustowość pamięci, a nie moc obliczeniowa. Przez większość czasu model czeka w VRAM na zapytanie, a GPU jest w stanie spoczynku.
Budując zestaw od zera, najwięcej zyskasz na VRAM, nie na procesorze. Karta z 16 GB to rozsądne minimum dla modeli klasy 12–14B z długim kontekstem. Procesor z dużą pamięcią L3, taki jak Ryzen 7 9800X3D, nie przyspieszy modelu w całości na GPU, ale ta sama maszyna służy też do grania i strumieniowania gier. To właśnie jej druga rola w tym labie.
Zaczynamy od przygotowania stacji roboczej.