Przewodnik

Własne AI bez chmury — przewodnik po lokalnych modelach

Jak uruchomić lokalny LLM na własnym komputerze: ile VRAM potrzeba, jaki model wybrać na kartę 16 GB, LM Studio i agent AI do automatyzacji — bez chmury.

Każde zapytanie do chatbota w chmurze to Twój kod, Twoje dokumenty albo Twoje notatki wysłane na cudzy serwer. Czasem to nie problem. Ale umowa z klientem, dokumentacja medyczna czy po prostu prywatny dziennik to dane, które nie powinny opuszczać domu.

Dobra wiadomość jest taka, że w 2026 roku karta graficzna do grania wystarczy, żeby uruchomić model językowy, który pisze kod, streszcza dokumenty i wywołuje narzędzia — w całości lokalnie, bez abonamentu i bez limitów zapytań. Ten przewodnik wyjaśnia, jak to policzyć, zanim cokolwiek pobierzesz, i prowadzi do działającego agenta, który na Twoje polecenie z Telegrama sprawdzi stan homelabu.

Co da się realnie zrobić lokalnie

Uczciwie, bez marketingu:

  • Tak: uzupełnianie i wyjaśnianie kodu, refaktoryzacja pojedynczych plików, pisanie skryptów, streszczanie i przeszukiwanie dokumentów, tłumaczenia, porządkowanie notatek, proste agenty wywołujące narzędzia (terminal, pliki, API).
  • Z trudem: długie, wieloetapowe zadania programistyczne na dużym repozytorium. Najlepsze modele w chmurze wciąż wyraźnie wygrywają przy złożonym planowaniu.
  • Nie: zastąpienie największych modeli chmurowych w najtrudniejszych zadaniach. Model mieszczący się w 16 GB VRAM ma kilkanaście miliardów parametrów, a nie kilkaset.

Rozsądna strategia: lokalnie wszystko, co dotyczy prywatnych danych i powtarzalnej pracy, chmura tylko do rzadkich, naprawdę trudnych problemów — i świadomie, bez wklejania do niej wrażliwych treści.

Ile VRAM potrzebuje lokalny LLM

Model generuje tekst token po tokenie i przy każdym tokenie odczytuje wszystkie swoje aktywne wagi. Pamięć karty graficznej (GDDR7 w RTX 5070 Ti) ma przepustowość rzędu kilkuset GB/s, zwykły RAM DDR5 — kilkadziesiąt. Dlatego model, który w całości mieści się w VRAM, działa kilka razy szybciej niż ten sam model podzielony między kartę a RAM.

W VRAM muszą zmieścić się trzy rzeczy:

  1. Wagi modelu — rozmiar pliku GGUF w wybranej kwantyzacji.
  2. KV cache — pamięć kontekstu. Rośnie liniowo z liczbą tokenów, które model „pamięta” w rozmowie.
  3. Bufory obliczeniowe i system — kilkaset MB na obliczenia plus to, co zajmuje pulpit Windowsa, przeglądarka z akceleracją i nakładki (zwykle 0,5–1,5 GB).

Pierwszą pozycję widać w nazwie pliku. Drugą większość poradników pomija, a to ona decyduje, czy model w ogóle się zmieści.

Rachunek KV cache — i dlaczego nie Qwen 2.5 Coder

Rozmiar KV cache na jeden token liczy się ze wzoru:

KV [bajty/token] = 2 (K i V) × warstwy z pełną uwagą × głowice KV × wymiar głowicy × bajty na element

Agent potrzebuje dużo kontekstu: prompt systemowy, opisy kilkudziesięciu narzędzi i historia rozmowy szybko przekraczają 30 tysięcy tokenów. Hermes Agent, którego używamy w tej serii, wymaga od modelu co najmniej 64K tokenów kontekstu i nie uruchomi się z mniejszym. Policzmy trzy popularne modele dla 64K (65 536 tokenów) i KV cache w FP16:

Model Wagi (plik) KV na token KV dla 64K Razem 16 GB?
Qwen2.5-Coder-14B, Q4_K_M 8,99 GB 192 KiB (48 warstw × 8 głowic × 128) 12 GiB ~21 GB ✗
gpt-oss-20b, MXFP4 ~12–13 GB 24 KiB (12 z 24 warstw pełnych × 8 × 64) 1,5 GiB ~14,5 GB ✓ na styk
Gemma 4 12B, Q6_K 9,79 GB 16 KiB (8 z 48 warstw pełnych × 1 × 512) ~1 GiB + 0,3 GiB okna ~11,5 GB ✓ z zapasem

Qwen 2.5 Coder 14B to świetny model do kodu i przez długi czas był domyślnym wyborem na karty 16 GB. Ale jego architektura liczy uwagę na pełnym kontekście w każdej z 48 warstw. Przy 64K sam kontekst zajmuje więcej niż model, a do tego oficjalny GGUF ma natywnie tylko 32K. Da się go wcisnąć (kwantyzacja KV cache do 4 bitów, rozciąganie kontekstu przez YaRN), ale kosztem jakości i bez zapasu pamięci.

Nowsze modele rozwiązują to architekturą: większość warstw widzi tylko okno przesuwne (np. ostatnie 1024 tokeny), a pełny kontekst obsługuje co szósta warstwa. W Gemmie 4 12B kontekst 64K kosztuje około jednego gigabajta zamiast dwunastu.

Jaki lokalny LLM wybrać? Gemma 4 12B

Do całej serii używamy Gemmy 4 12B (Google DeepMind, licencja Apache 2.0):

  • Kontekst natywnie do 256K, więc 64K dla agenta to jedna czwarta możliwości, bez rozciągania.
  • Natywne wywoływanie narzędzi (function calling) — podstawa pracy agenta.
  • Kod: 72% w LiveCodeBench v6 według karty modelu.
  • Multimodalność: rozumie obrazy (zrzuty ekranu błędów, skany dokumentów), co przyda się przy przetwarzaniu dokumentów.
  • Tryb rozumowania (thinking) do trudniejszych zadań.

W kwantyzacji Q6_K (9,79 GB) jakość jest praktycznie nieodróżnialna od pełnej precyzji, a całość z kontekstem 64K zajmuje około 11,5 GB. Na karcie 16 GB zostaje ponad 4 GB zapasu na system i dłuższe rozmowy.

Alternatywa: gpt-oss-20b (OpenAI, Apache 2.0) — model MoE z 3,6 mld aktywnych parametrów, bardzo szybki i dobry w wywoływaniu narzędzi, ale bez obsługi obrazów i z mniejszym zapasem VRAM. Sprawdzi się, jeśli Gemma okaże się za wolna w Twoich zadaniach.

Stos narzędzi

Architektura lokalnego AI
┌───────────────────────── Stacja robocza (Windows 11) ─────────────────────────┐
│ │
│ Hermes Agent ── narzędzia: terminal, pliki, przeglądarka, pamięć, cron │
│ │ │
│ │ OpenAI-compatible API (http://localhost:1234/v1) │
│ ▼ │
│ LM Studio (serwer) ── Gemma 4 12B Q6_K, 64K kontekstu ── RTX 5070 Ti 16 GB │
│ │
└────────┬───────────────────────────────────────────────┬──────────────────────┘
│ SSH (klucz z wymuszonym poleceniem) │ Telegram Bot API
▼ ▼
Proxmox / homelab: raport stanu telefon: rozmowa z agentem,
(tylko do odczytu) poranne raporty
  • LM Studio pobiera modele, zarządza pamięcią GPU i udostępnia je przez API zgodne z OpenAI. Ma interfejs graficzny, ale też CLI lms do automatyzacji.
  • Hermes Agent (Nous Research) to agent z własną pamięcią, kilkudziesięcioma narzędziami, harmonogramem zadań i bramką do komunikatorów. Działa natywnie na Windowsie.
  • Telegram służy za interfejs z telefonu, ten sam, którego używamy do alertów z monitoringu.

Plan serii

  1. Stacja robocza pod lokalne AI — BIOS i pamięć dla Ryzena 9800X3D, sterowniki NVIDIA, polityka Sysmem Fallback, uwolnienie VRAM i monitoring.
  2. LM Studio i Gemma 4 12B — dobór kwantyzacji, kontekst 64K, flash attention, serwer API w tle i test wywoływania narzędzi.
  3. Hermes Agent — instalacja, bezpieczeństwo i Telegram — połączenie z LM Studio, zatwierdzanie poleceń, bramka Telegram z listą dozwolonych użytkowników.
  4. Hermes Agent w praktyce — codzienny raport z homelabu, pomoc przy kodzie i przetwarzanie dokumentów bez chmury.

Ile to kosztuje

Jeśli masz już kartę z 16 GB VRAM — nic poza prądem. Karta pod obciążeniem generowania pobiera zwykle mniej niż w grach, bo generowanie tokenów ogranicza przepustowość pamięci, a nie moc obliczeniowa. Przez większość czasu model czeka w VRAM na zapytanie, a GPU jest w stanie spoczynku.

Budując zestaw od zera, najwięcej zyskasz na VRAM, nie na procesorze. Karta z 16 GB to rozsądne minimum dla modeli klasy 12–14B z długim kontekstem. Procesor z dużą pamięcią L3, taki jak Ryzen 7 9800X3D, nie przyspieszy modelu w całości na GPU, ale ta sama maszyna służy też do grania i strumieniowania gier. To właśnie jej druga rola w tym labie.

Zaczynamy od przygotowania stacji roboczej.