Model AI na laptopie pracownika: które kontrole tracą sygnał

Lokalny model AI w firmie zmienia miejsce, w którym trzeba szukać śladów jego użycia. Dwa mechanizmy wykorzystywane do nadzoru nad korzystaniem ze sztucznej inteligencji, czyli dzienniki po stronie dostawcy i kontrola ruchu wychodzącego, tracą sygnał, bo sama inferencja wykonuje się na urządzeniu i może nie wygenerować żadnego połączenia. Nie znaczy to, że system jest odcięty od sieci: pobranie wag, aktualizacje oraz narzędzia, z których korzysta agent, ruch nadal generują. W sierpniu 2026 dwaj producenci udostępnili w odstępie doby modele agentowe o trzydziestu miliardach parametrów, mieszczące się na sprzęcie z górnej półki tego, co firmy kupują konstruktorom i analitykom (Meta AI Research, 10.08.2026; NVIDIA, 11.08.2026). Pytanie przestaje więc brzmieć „czy ktoś to uruchomi”, a zaczyna „po czym to rozpoznamy”.

Wnioski dla decydenta:

  • Sama inferencja lokalna nie trafia do dzienników dostawcy i nie generuje rachunku za użycie, więc obie te kontrole tracą sygnał, na którym pracują. Ruch sieciowy może nadal występować przy pobieraniu modeli, aktualizacjach i wywołaniach narzędzi.
  • Próg sprzętowy spadł: Meta Muse Glimmer ma 30 mld parametrów, licencję Apache 2.0, a po kompresji do czterech bitów schodzi poniżej 20 GB i mieści się razem z pamięcią roboczą w kopercie 24 GB albo 32 GB (Meta AI Research, 2026).
  • Dystans jakościowy do modeli zamkniętych zmalał, ale nie zniknął: 57 kontra 61 punktów w indeksie Artificial Analysis, stan na lipiec 2026 według zestawienia Mozilli.
  • Ta sama cecha, którą dział bezpieczeństwa uznaje za zaletę, jest powodem, dla którego po lokalne modele sięgnęła grupa napastnicza opisana przez Genians (10.08.2026).
  • Kontrola kompensująca nie leży w polityce, tylko w trzech warstwach na urządzeniu: inwentaryzacji oprogramowania, telemetrii plików i telemetrii procesów. Warstwa sieciowa może nie zobaczyć samej inferencji.

Czym jest lokalny model AI i czym różni się od modelu w chmurze

Lokalny model AI to model, którego wagi zostały pobrane na urządzenie i który wykonuje obliczenia na tym urządzeniu, bez wysyłania zapytań do serwera dostawcy. Z punktu widzenia użytkownika różnica bywa niewidoczna, bo interfejs wygląda podobnie. Z punktu widzenia kontroli różnica jest zasadnicza: nie powstaje żaden zapis po stronie trzeciej.

Modele o otwartych wagach nie są tym samym co oprogramowanie o otwartym kodzie. Udostępniane są parametry modelu i licencja na ich użycie, natomiast dane treningowe i pełny proces uczenia zwykle pozostają zamknięte. Dla firmy istotny jest skutek praktyczny: wagi można skopiować, przenieść i uruchomić bez rejestracji konta.

Trzecia różnica dotyczy trwałości. Konto w usłudze da się odebrać jednym kliknięciem przy odejściu pracownika. Pliki z wagami zostają na urządzeniu, a to, czy zostaje także historia rozmów, zależy od użytego narzędzia i jego ustawień.

Warto rozdzielić dwa pojęcia, które w rozmowach zlewają się w jedno. Lokalny model AI nie jest tym samym co shadow AI: lokalność opisuje miejsce wykonywania obliczeń, a shadow AI oznacza użycie technologii poza zatwierdzonym nadzorem organizacji. Model lokalny wdrożony decyzją firmy nie jest shadow AI, a narzędzie chmurowe używane bez wiedzy działu bezpieczeństwa nim jest.

Co się zmieniło w sierpniu 2026

Zmienił się próg sprzętowy dla modeli agentowych, czyli takich, które nie tylko odpowiadają, lecz także wywołują narzędzia i wykonują wieloetapowe zadania. W ciągu jednej doby dwaj producenci udostępnili modele o zbliżonej wielkości przeznaczone do pracy lokalnej.

Meta udostępniła model Muse Glimmer: 30 mld parametrów, wagi na licencji Apache 2.0, kompresja do czterech bitów sprowadzająca model językowy „to under 20 GB”, a testowany wariant oznaczono jako K-Quant-17GB. Producent pisze, że model wraz z pamięcią podręczną, koderem percepcji i modelem pomocniczym do dekodowania spekulatywnego mieści się „within a 24 GB or 32 GB envelope”. Testy prowadzono na MacBookach M4-Max i M5-Max oraz na karcie RTX 5090, a model ma wywoływać narzędzia, prowadzić rozumowanie wieloetapowe i działać „with or without an internet connection” (Meta AI Research, 10.08.2026).

Dzień później NVIDIA udostępniła Nemotron 3.5 Lightning, model o otwartych wagach w architekturze mieszanki ekspertów, również trzydziestomiliardowy, opisany wprost jako przeznaczony dla agentów działających lokalnie i wspierany przez narzędzia takie jak Ollama, llama.cpp i LM Studio (NVIDIA, 11.08.2026).

Znaczenie tej pary zdarzeń nie polega na parametrach. Polega na tym, że wymagany sprzęt przestał być sprzętem specjalistycznym, a stał się górną półką sprzętu, który firmy i tak kupują konstruktorom, analitykom i programistom. To nadal nie jest przeciętny laptop firmowy.

Czy lokalny model dorównuje modelom zamkniętym

Nie dorównuje czołówce, ale różnica zmalała do jednego cyklu wydawniczego. Raport Mozilli z lipca 2026 zestawia 57 punktów dla najlepszego modelu o otwartych wagach (Kimi K3) wobec 61 punktów dla czołowego modelu zamkniętego w indeksie Artificial Analysis Intelligence Index w wersji 4.1, oraz 156 wobec 162 punktów w Epoch Capabilities Index. Obie pary to stan na lipiec 2026, a indeksy są aktualizowane, więc bieżące wartości mogą się różnić.

Porównanie modeli o otwartych wagach i zamkniętych w dwóch indeksach zdolności według raportu Mozilli
Według raportu Mozilli z lipca 2026 najlepszy model o otwartych wagach dzieli od czołowego modelu zamkniętego 4 punkty w indeksie Artificial Analysis i 6 punktów w Epoch Capabilities Index.

Raport zestawia też dwa mierniki, które łatwo pomylić, a które mówią różne rzeczy. Udział w routingu tokenów u pośrednika OpenRouter przesunął się od wartości pomijalnej, przez około jedną trzecią pod koniec 2025, do większości tokenów w połowie 2026. Udział w przychodach wygląda odwrotnie: w oknie od maja do września 2025 modele zamknięte odpowiadały za około 80 procent użycia i około 96 procent przychodów na tej samej platformie.

Te dwie liczby nie są sprzeczne, bo opisują różne okresy i różne wielkości. Pierwsza mierzy wolumen tokenów u jednego pośrednika, druga pieniądze. Wniosek dla firmy jest taki, że modele otwarte wygrywają tam, gdzie liczy się objętość i koszt, a zamknięte utrzymują przewagę w zadaniach najtrudniejszych.

Zastrzeżenie warto postawić precyzyjnie. Mozilla jest stroną zaangażowaną w rozwój otwartego ekosystemu, więc ostrożnie należy czytać dobór i interpretację wskaźników. Same porównywane wyniki nie są jednak pomiarami Mozilli: pochodzą z indeksu Artificial Analysis, z Epoch AI oraz z tablicy routingu OpenRouter.

Które kontrole przestają działać

Model bez ruchu wychodzącego dla samej inferencji i bez rachunku za wywołania wypada z pola widzenia części kontroli zaprojektowanych dla usług w chmurze. Poniższe zestawienie pokazuje, gdzie pozostaje użyteczny sygnał kontrolny, a gdzie znika.

Mechanizm kontroli Model w chmurze dostawcy Model lokalny na urządzeniu Czym zastąpić
Dziennik zapytań po stronie dostawcy jest brak inwentaryzacja oprogramowania oraz telemetria procesów i plików
Kontrola ruchu wychodzącego wykrywa brak ruchu dla samej inferencji, jeśli model działa bez sieci telemetria procesów i plików, nie tylko sieci
Limit wydatków jako sygnał nadużycia działa brak metryki zużycia i rachunku za wywołania sygnałów szukać w zakupach sprzętu i w telemetrii stacji, bo koszt przechodzi na sprzęt, energię i administrację
Umowa powierzenia danych z dostawcą może mieć zastosowanie przy czysto lokalnym przetwarzaniu nie ma zewnętrznego dostawcy modelu obowiązki administratora i kontrola procesu pozostają
Odebranie dostępu przy odejściu pracownika wyłączenie konta wagi i dane lokalne mogą zostać na urządzeniu procedura zwrotu i czyszczenia sprzętu

Wiersz trzeci jest ciągiem dalszym wątku, który opisałem w tekście Koszt używania AI i paradoks Jevonsa: twardy limit wydatków bywa pierwszym mechanizmem, który wykrywa nieprawidłowe użycie. Model lokalny tę kontrolę wyłącza, bo nie generuje rachunku.

Wiersz czwarty wymaga ostrożności w drugą stronę. Umowa powierzenia dotyczy sytuacji, w której podmiot przetwarza dane osobowe w imieniu administratora. Uruchomienie modelu lokalnie może usunąć jednego zewnętrznego przetwarzającego, ale nie usuwa ani obowiązków administratora, ani innych podmiotów przetwarzających, które w procesie pozostają. Zakres obowiązków w konkretnym przypadku warto ustalić z inspektorem ochrony danych, bo zależy od tego, jakie dane trafiają do modelu i na czyim sprzęcie.

Ta sama cecha po drugiej stronie barykady

Argument „nic nie wychodzi na zewnątrz” działa identycznie dla działu bezpieczeństwa i dla napastnika. Genians Security Center opisało 10 sierpnia 2026 kampanię, w której na infrastrukturze napastnika znaleziono narzędzia do lokalnego uruchamiania modeli: Ollama, GPT4All w wersji 0.4.2 z funkcją LocalDocs oraz Msty.

Motyw podano wprost: „Because the local approach prevents conversation data from being transmitted to external AI services, it reduces the risk of external exposure, making it particularly attractive for a state-sponsored threat actor”.

Nie przenoszę z tego alarmu, bo cele kampanii, czyli misje dyplomatyczne i sektor bezpieczeństwa, leżą poza profilem typowej polskiej firmy. Przenoszę mechanizm: cecha, którą firma kupuje jako ochronę poufności, jest tą samą cechą, która usuwa widoczność jej własnych kontroli. To rozstrzyga, dlaczego lokalny model wymaga innej kontroli, a nie mniejszej.

Po czym rozpoznać, że w firmie działa lokalny model

Po tym, co zostaje na urządzeniu, a nie po tym, co przechodzi przez sieć. Skuteczne podejście ma trzy warstwy, bo żadna z nich osobno nie wystarcza.

Warstwa pierwsza: inwentaryzacja oprogramowania. Wykrywa zainstalowane narzędzia do uruchamiania modeli i jest kontrolą, którą większość firm już ma. Nie wystarcza, bo część takich narzędzi działa jako przenośna binarka uruchamiana bez instalacji, z katalogu użytkownika, z kontenera albo ze środowiska programistycznego, a wtedy w wykazie aplikacji się nie pojawi.

Warstwa druga: telemetria plików. Wagi modelu zajmują gigabajty i mają charakterystyczne formaty. Bywają jednym plikiem, ale bywają też podzielone na części, więc szukać warto rozmiaru i rozszerzenia, nie pojedynczego pliku. Pomocne są przewidywalne lokalizacje, na przykład katalog konfiguracyjny `.ollama`.

Warstwa trzecia: telemetria procesów. Zdarzenia uruchomienia procesu wraz z pełnym poleceniem i ścieżką wykrywają to, czego dwie poprzednie warstwy nie zobaczą, łącznie z binarką uruchomioną raz i skasowaną.

Sygnały pomocnicze, nie kontrole. Obciążenie karty graficznej jest wskazówką, nie dowodem: projektowanie, renderowanie i analiza danych dają ten sam obraz, a model może pracować również na procesorze. Podobnie wniosek o laptop z 32 GB pamięci i mocną kartą w dziale pracującym dotąd na sprzęcie podstawowym: to sygnał wczesny i tani, ale sam niczego nie przesądza.

Uprawnienia, którymi taki model dysponuje po uruchomieniu, opisałem osobno w tekście Agenci AI w firmie: produktywność bez nadzoru.

Trzy branże, trzy różne układy

Ekspozycja zależy od tego, jakie dane trafiają do modelu i czyj jest sprzęt, a nie od samej branży. Poniższe trzy przypadki różnią się przede wszystkim tym, który dokument przestaje opisywać rzeczywistość.

Biura rachunkowe i działy finansowe. Jeżeli model i dane działają wyłącznie na infrastrukturze organizacji, odpada umowa z zewnętrznym dostawcą modelu jako podmiotem przetwarzającym. Nie odpadają natomiast obowiązki administratora ani umowy z innymi podmiotami przetwarzającymi obecnymi w procesie.

Kancelarie i doradztwo. Tajemnica zawodowa jest tu argumentem za modelem lokalnym, i to argumentem mocnym. Warunkiem jest, żeby uruchomienie było decyzją organizacji, a nie inicjatywą pojedynczej osoby na prywatnym sprzęcie.

Produkcja z własnym działem konstrukcyjnym. Ryzyko dotyczy nie tyle samego modelu, ile kopii dokumentacji technicznej, która zostaje na urządzeniu razem z historią rozmów.

Kluczowe pytania i decyzje

Dwie decyzje wracają w każdej rozmowie o modelach lokalnych: czy ich zakazać oraz czy są bezpieczniejsze od chmury. Na obie odpowiedź brzmi „to zależy od warstwy”, a nie „tak” albo „nie”.

Czy zakazać pracownikom uruchamiania modeli lokalnie?

Nie jako pierwszy ruch. Zakaz bez mechanizmu wykrywania przenosi zjawisko na sprzęt prywatny, gdzie firma nie ma już żadnej widoczności, a jednocześnie odbiera uzasadnione zastosowania z danymi wrażliwymi.

Tak w odniesieniu do sprzętu prywatnego i danych chronionych, jeżeli firma jednocześnie udostępni ścieżkę legalną: wskazane narzędzie, wskazany sprzęt, zapisana zasada, co wolno do modelu wprowadzić.

Czy model lokalny jest bezpieczniejszy od modelu w chmurze?

Tak pod względem transferu danych podczas samej lokalnej inferencji: prompt i odpowiedź nie muszą opuszczać urządzenia ani trafiać do dostawcy modelu. Przewaga znika częściowo, jeśli agent korzysta z zewnętrznych narzędzi albo usług.

Nie pod względem kontroli, bo znika dziennik po stronie dostawcy, może zniknąć ruch związany z samą inferencją i znika możliwość odebrania dostępu z poziomu konta. Bezpieczeństwo przenosi się z warstwy umownej na warstwę zarządzania stacją roboczą, którą trzeba mieć.

Kiedy ta analiza się nie sprawdzi

Opisany mechanizm słabnie w czterech sytuacjach: gdy sprzęt nie spełnia progu, gdy model lokalny jest wyborem właściwym, gdy liczby o udziale rynkowym są węższe, niż się wydaje, oraz gdy firma nie zarządza własnymi stacjami roboczymi.

Gdy sprzęt w firmie nie spełnia progu. Zapas pamięci od 24 do 32 GB i mocna karta graficzna to nadal nie jest przeciętny laptop firmowy. Opisuję okno, które się otwiera, a nie zjawisko masowe.

Gdy lokalny model jest właściwym wyborem. Dla części zastosowań z danymi wrażliwymi brak transferu do dostawcy jest realną przewagą, także prawną. Rzecz w tym, żeby zrobić to w sposób kontrolowany, a nie żeby tego unikać.

Gdy liczby o udziale rynkowym okażą się węższe, niż sugerują. Pomiar routingu tokenów pochodzi od jednego pośrednika i jest skoncentrowany w zastosowaniach programistycznych i agentowych. Nie opisuje całego rynku.

Gdy firma nie ma zarządzania stacjami roboczymi. Wszystkie kontrole kompensujące z tego tekstu zakładają, że firma widzi, co jest zainstalowane na jej sprzęcie. Bez tego założenia zostaje wyłącznie polityka na papierze.

Podsumowanie

Model uruchomiony lokalnie nie jest ani groźniejszy, ani bezpieczniejszy od modelu w chmurze. Jest inaczej widoczny, a to wystarcza, żeby zestaw kontroli zaprojektowany dla usług sieciowych przestał opisywać rzeczywistość. Dziennik po stronie dostawcy, analiza ruchu wychodzącego, limit wydatków i umowa powierzenia to cztery mechanizmy, które przy modelu lokalnym albo nie mają czego obserwować, albo nie mają zastosowania.

W sierpniu 2026 próg wejścia wyraźnie się obniżył: dwa modele agentowe o trzydziestu miliardach parametrów, przeznaczone do pracy na urządzeniu, w odstępie jednej doby. Dystans do modeli zamkniętych zmalał do kilku punktów w dwóch indeksach zdolności, według zestawienia Mozilli z lipca 2026. Same wyniki pochodzą z Artificial Analysis i Epoch AI, natomiast ich dobór i interpretację warto czytać w kontekście prootwartego stanowiska wydawcy raportu.

Praktyczny wniosek nie brzmi „zakazać”. Brzmi: sprawdzić, czy inwentaryzacja oprogramowania obejmuje narzędzia do uruchamiania modeli, ustalić, kto w firmie ma sprzęt zdolny taki model udźwignąć, i zapisać, co wolno do niego wprowadzić. W organizacji, która już zarządza stacjami roboczymi, większość tych działań da się osadzić w istniejących procesach. Tam, gdzie nie ma inwentaryzacji ani telemetrii urządzeń końcowych, problem jest szerszy niż samo AI.

O autorze

Remigiusz Pruszczak: ekspert GenAI i trener AI, makler papierów wartościowych z uprawnieniami do wykonywania czynności doradztwa inwestycyjnego (licencja nr 2343). Ponad 30 lat w finansach. Od 17 lat prowadzi szkolenia, a od 2025 roku również z generatywnej AI, między innymi dla banków, instytucji finansowych, kancelarii oraz firm z sektorów regulowanych i produkcji. Szkolenia realizuje we współpracy z EY Academy of Business Polska, Warszawskim Instytutem Bankowości, Bankowym Ośrodkiem Doradztwa i Edukacji oraz CFA Society Poland. Więcej na stronie „O mnie”.

Źródła

  1. Meta AI Research, Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device, 10 sierpnia 2026: https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
  2. NVIDIA, NVIDIA and Local AI Community Fuel Open Source Models and Intelligent Agents (Nemotron 3.5 Lightning), 11 sierpnia 2026: https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/
  3. Mozilla, The State of Open Source AI Report, lipiec 2026: https://stateofopensource.ai/
  4. Genians Security Center, Kimsuky Integrates AI into Attack Operations, From AI-Generated Decoy Documents to a Local LLM, 10 sierpnia 2026: https://www.genians.co.kr/en/blog/threat_intelligence/kimsuky_ai_llm