W 2025 roku sztucznej inteligencji używało 20% przedsiębiorstw w Unii Europejskiej, wobec 13,5% rok wcześniej. W Polsce odsetek ten wynosił 8,4%. Najczęstszym zastosowaniem była analiza języka pisanego, z której korzystało 11,8% firm objętych badaniem. Autorzy badania opublikowanego w 2026 roku w Organization Science opisali to zjawisko jako „jagged technological frontier”, czyli nierównomierną granicę możliwości AI: zadania o podobnym poziomie trudności dla człowieka mogą sprawiać modelowi zupełnie różne trudności. Kolejny etap wymaga odpowiedzi na bardziej precyzyjne pytanie: jaka forma AI pasuje do konkretnego zadania?
W eksperymencie przeprowadzonym wśród 758 konsultantów osoby korzystające z GPT-4 wykonały 12,2% więcej zadań i ukończyły je średnio o 25,1% szybciej, gdy zadania mieściły się w zakresie możliwości modelu. Przy złożonym zadaniu wykraczającym poza ten zakres prawdopodobieństwo poprawnego rozwiązania spadło o 19 punktów procentowych. Autorzy badania opublikowanego w 2026 roku w Organization Science nazwali tę nieregularną granicę możliwości AI „jagged technological frontier”.
Efektywność wynika więc z dopasowania technologii do zadania, danych, ryzyka i sposobu kontroli wyniku. Dla jednego procesu właściwym rozwiązaniem będzie firmowy asystent LLM. Drugi będzie wymagał aplikacji połączonej z CRM, bazą wiedzy i systemem uprawnień. W trzecim sprawdzi się niewielki model działający lokalnie. Operacje o jednoznacznych regułach można powierzyć kodowi, silnikom reguł lub robotyzacji procesów biznesowych (RPA). Klasyczne uczenie maszynowe sprawdza się między innymi w prognozowaniu i klasyfikacji danych.
1. LLM i SLM w firmie: wybór modelu, integracji i miejsca przetwarzania danych
Określenia „LLM”, „wdrożony LLM” i „zamknięty SLM” łączą kilka warstw technologii. W praktyce biznesowej warto rozdzielić cztery decyzje:
Sposób pracy: czy pracownik rozmawia z gotowym asystentem, czy proces uruchamia się automatycznie?
Zakres integracji: czy rozwiązanie pracuje na materiałach przekazanych przez użytkownika, czy pobiera dane i wykonuje działania w systemach firmy?
Klasa modelu: czy zadanie wymaga szerokich możliwości dużego modelu językowego, czy wystarczy wyspecjalizowany SLM?
Miejsce przetwarzania: czy model działa jako usługa chmurowa, w wydzielonym środowisku, w prywatnej chmurze, lokalnie albo bezpośrednio na urządzeniu?
Skrót SLM (Small Language Model) oznacza mały model językowy, zwykle wymagający mniej zasobów obliczeniowych. Określenie „system zamknięty” wymaga doprecyzowania: może odnosić się do ograniczonego dostępu, odizolowanego środowiska lub przetwarzania danych we własnej infrastrukturze. Duży LLM może działać w środowisku prywatnym, a SLM może być udostępniany przez publiczne API. Sama wielkość modelu nie określa warunków bezpieczeństwa danych.
2. Sześć sposobów wykorzystania AI w procesach biznesowych
Wariant
Jak działa
Najlepsze dopasowanie
Główny miernik
Firmowy asystent LLM
Pracownik zleca zadanie i sprawdza wynik w zatwierdzonym środowisku, np. ChatGPT Business lub Enterprise
Analiza, redagowanie, podsumowanie, przygotowanie wariantów, praca ad hoc
Oszczędność czasu na zadanie po uwzględnieniu weryfikacji i poprawek
Zintegrowana aplikacja LLM lub RAG
Model korzysta z firmowych źródeł, reguł, uprawnień i integracji
Powtarzalne procesy oparte na dokumentach, wiedzy i danych z systemów
Koszt poprawnie zakończonej sprawy
Agent AI
Rozwiązanie planuje kolejne kroki, wybiera narzędzia i realizuje cel w określonym zakresie
Wieloetapowe procesy z wyjątkami i dynamiczną ścieżką
Odsetek poprawnie wykonanych zadań
SLM
Mniejszy model obsługuje wąski zakres zadań w chmurze, na serwerze firmy, na edge albo na urządzeniu
Duża liczba zadań, stały zakres tematyczny, krótki czas odpowiedzi, praca offline
Jakość w porównaniu z LLM przy określonym koszcie i limicie czasu odpowiedzi p95
Prywatne lub lokalne wdrożenie
LLM albo SLM działa w kontrolowanym środowisku, prywatnej chmurze, sieci firmy lub na urządzeniu
Wymogi lokalizacji danych, ciągłości działania, łączności, infrastruktury lub polityki bezpieczeństwa
Zgodność z wymaganiami, jakość, dostępność i całkowity koszt posiadania i użytkowania rozwiązania (TCO)
Reguły, RPA lub klasyczne ML
Przebieg procesu jest zapisany w kodzie, warunkach, modelu predykcyjnym lub maszynie stanów
Obliczenia, transakcje, stałe ścieżki i jednoznaczne decyzje
Dokładność, powtarzalność i kompletność śladu audytowego
W dojrzałym wdrożeniu warianty te często współpracują. Model językowy interpretuje wiadomość, reguły sprawdzają warunki, aplikacja pobiera dane, człowiek zatwierdza działanie, a system transakcyjny zapisuje wynik.
3. Do jakich zadań wykorzystać ChatGPT lub innego asystenta LLM?
Gotowy asystent LLM dobrze wspiera zadania, w których pracownik odpowiada za sprawdzenie i wykorzystanie wyniku. Użytkownik inicjuje pracę, przekazuje kontekst, ocenia odpowiedź i decyduje o jej wykorzystaniu. Wynik ma formę projektu, rekomendacji, analizy lub materiału roboczego.
Do tej grupy należą między innymi:
przygotowanie pierwszej wersji raportu, wiadomości, prezentacji lub artykułu,
streszczenie dokumentów i korespondencji,
porównanie kilku materiałów dostarczonych przez użytkownika,
tworzenie pytań, scenariuszy i wariantów rozwiązania,
tłumaczenie treści przeznaczonych do dalszej kontroli,
eksploracyjna analiza danych i wyjaśnianie wyników,
porządkowanie notatek ze spotkania,
przygotowanie projektu procedury lub planu działania.
Taki sposób pracy sprawdza się w procesach, gdy każda odpowiedź przechodzi kontrolę człowieka, rezultat można łatwo poprawić lub wycofać, a zadanie nie wymaga automatycznego zapisu w systemie krytycznym. Duża zmienność materiału i potrzeba pracy językowej dodatkowo zwiększają użyteczność LLM.
Bezpieczeństwo zależy od zatwierdzonego produktu i konfiguracji. OpenAI deklaruje, że dane z ChatGPT Business, ChatGPT Enterprise i API nie są domyślnie wykorzystywane do trenowania modeli. Dokumentacja kontroli danych API opisuje również oddzielne zasady retencji, w tym standardowe rejestry służące monitorowaniu nadużyć oraz opcję Zero Data Retention dla klientów spełniających określone warunki. Przed rozpoczęciem pracy organizacja powinna sprawdzić klasyfikację danych, umowę, region przetwarzania, retencję, uprawnienia administratorów i zasady korzystania z połączonych aplikacji. Więcej przykładów takiej pracy zawiera zestawienie 15 integracji ChatGPT z aplikacjami biznesowymi.
3.1 Jak mierzyć oszczędność czasu i jakość pracy z LLM?
Badanie pracowników wyłącznie za pomocą ankiety może zawyżać efekt. W eksperymencie METR doświadczeni programiści wykonywali badane zadania z narzędziami AI o 19% dłużej, a po eksperymencie nadal oceniali, że AI przyspieszyła ich pracę o 20%. Badanie obejmowało 16 osób i 246 rzeczywistych zadań w znanych im repozytoriach, więc jego wynik dotyczy tego konkretnego środowiska. Metodologiczny wniosek ma szersze zastosowanie: przed wdrożeniem trzeba zmierzyć rzeczywisty czas i jakość.
Dla asystenta LLM warto monitorować medianę czasu wykonania zadania, udział wyników zaakceptowanych bez zmian, średni czas poprawek, jakość ocenianą według jednolitych kryteriów, częstotliwość użycia oraz liczbę przypadków, w których użytkownik wrócił do poprzedniej metody pracy.
4. Kiedy zintegrować LLM z systemami firmy, a kiedy wdrożyć agenta AI?
Integracja staje się uzasadniona, gdy wartość procesu zależy od aktualnych danych firmy, powtarzalnego przebiegu i współpracy kilku systemów. Model otrzymuje wtedy kontrolowany dostęp do dokumentów, bazy wiedzy, CRM, ERP, systemu zgłoszeń albo poczty. Aplikacja weryfikuje tożsamość użytkownika, kontroluje zakres udostępnianych danych, ustala format odpowiedzi, sprawdza wyniki, rejestruje działania i kieruje wybrane operacje do zatwierdzenia.
Typowa zintegrowana aplikacja AI obejmuje pięć warstw:
Wejście: wiadomość, dokument, formularz, zdarzenie systemowe lub rekord.
Kontekst: dane pobrane zgodnie z uprawnieniami, często z wykorzystaniem RAG.
Model: LLM albo SLM dobrany do konkretnego etapu.
Walidacja: reguły, kontrola kompletności, sprawdzenie źródeł, klasyfikacja ryzyka.
Wynik: odpowiedź dla człowieka, projekt rekordu albo zatwierdzone działanie w systemie.
Takiej architektury wymagają między innymi wyszukiwanie odpowiedzi w wewnętrznej bazie wiedzy, analiza umów według firmowej listy ryzyk, przygotowanie oferty na podstawie CRM i cennika, klasyfikowanie zgłoszeń, wdrażanie nowych pracowników, weryfikacja dokumentów zakupowych oraz tworzenie odpowiedzi na podstawie historii klienta. Mechanizm RAG pozwala pobierać aktualne fragmenty zatwierdzonych źródeł i dołączać je do kontekstu odpowiedzi.
Agent AI jest kolejnym poziomem integracji. Otrzymuje cel, dobiera narzędzia i planuje sekwencję działań. Według aktualnych wytycznych Google Cloud dotyczących architektury agentowej agenci pasują do otwartych, wieloetapowych problemów wymagających użycia danych zewnętrznych i pewnego zakresu autonomii. Do przygotowania pojedynczego streszczenia lub tłumaczenia zwykle wystarcza aplikacja o z góry ustalonej sekwencji działań.
Rolę zaawansowanego modelu jako warstwy wnioskowania połączonej z narzędziami, danymi i uprawnieniami szerzej opisujemy w artykule GPT-5.5 dla biznesu: nowa era agentów AI.
Zakres samodzielnych działań agenta można rozszerzać, gdy wyniki testów potwierdzają wymaganą skuteczność i bezpieczeństwo. Uprawnienia agenta warto ograniczyć do funkcji potrzebnych w danym procesie, rozdzielić odczyt od zapisu i wprowadzić zatwierdzenie działań o istotnych skutkach dla firmy lub klienta. OWASP określa nadmierną funkcjonalność, zbyt szerokie uprawnienia i nadmierną autonomię jako trzy główne źródła ryzyka Excessive Agency. Zasada najmniejszych uprawnień ogranicza skutki błędnej interpretacji, wygenerowania nieprawdziwej informacji lub ataku polegającego na podsunięciu modelowi złośliwych instrukcji (prompt injection).
5. Do jakich procesów biznesowych sprawdzi się mały model językowy SLM?
Small Language Model wykorzystuje mniej parametrów i zasobów obliczeniowych niż duży model językowy. Według Microsoft Azure sprzyja to krótszemu czasowi odpowiedzi, niższemu zapotrzebowaniu na infrastrukturę oraz przetwarzaniu danych blisko miejsca ich powstawania (edge computing), np. na urządzeniach przemysłowych. Wyspecjalizowany SLM może sprawdzić się w zadaniach o stałej tematyce, przewidywalnych danych wejściowych i jasno określonym wyniku.
Warto przetestować SLM, gdy proces spełnia kilka z poniższych warunków:
stały zestaw kategorii, intencji, pól albo typów odpowiedzi,
wysoki i przewidywalny wolumen wywołań,
krótki wymagany czas reakcji mierzony jako p95, czyli wartość, której nie przekracza 95% czasów odpowiedzi,
ograniczone zasoby sprzętowe,
potrzeba pracy offline lub bezpośrednio na urządzeniu,
dostęp do danych z danego obszaru działalności oraz zestawu wzorcowych odpowiedzi,
możliwość przekazywania trudnych przypadków do większego modelu lub człowieka.
Przykładem może być klasyfikacja zgłoszeń według 30 stałych kategorii, rozpoznawanie intencji rozmówcy, odczytywanie wartości pól z jednego typu dokumentu, generowanie krótkich odpowiedzi w ściśle określonym zakresie tematycznym albo lokalna analiza komunikatów na urządzeniu przemysłowym.
O wyborze decyduje wynik testu na danych firmy. SLM powinien osiągnąć wymagany poziom jakości, czasu odpowiedzi i kosztu poprawnie obsłużonej sprawy. Firma może przykładowo wymagać, aby mniejszy model utrzymywał co najmniej 98% jakości referencyjnego LLM, obniżał koszt poprawnego wyniku o co najmniej 20% i mieścił się w limicie p95. Są to przykładowe progi decyzyjne, które właściciel procesu ustala przed pilotażem.
5.1 Kiedy wdrożyć LLM lub SLM lokalnie albo w prywatnej chmurze?
Prywatne lub lokalne wdrożenie może wynikać z wymagań dotyczących suwerenności danych, polityki bezpieczeństwa, ciągłości pracy, opóźnień sieciowych albo środowiska bez dostępu do internetu. Takie wdrożenie może wykorzystywać SLM lub większy model. Równocześnie firmowa aplikacja może korzystać z zarządzanego API z szyfrowaniem, kontrolą retencji, odpowiednim regionem i umową dotyczącą danych.
Najbardziej efektywna bywa architektura kaskadowa. Microsoft opisuje model hybrydowy, w którym SLM obsługuje typowe zapytania i przekazuje bardziej złożone przypadki do LLM. W środowisku biznesowym do tej kaskady warto dodać trzecią ścieżkę: przekazanie sprawy pracownikowi, gdy wynik budzi wątpliwości, ryzyko jest wysokie lub brakuje wymaganych danych.
6. Które procesy zautomatyzować za pomocą reguł, RPA lub uczenia maszynowego?
Procesy o stałych regułach wymagają jasno określonej kolejności działań i warunków ich wykonania. Dokumentacja AWS dotycząca orkiestracji rozdziela przepływy regułowe, w których kolejne stany i przejścia są jawnie zapisane, oraz orkiestrację agentową, w której model interpretuje cel i dynamicznie wybiera narzędzia. Obie warstwy mogą działać w jednej aplikacji.
Proces
Rekomendowany mechanizm
Rola modelu językowego
Naliczenie podatku, wynagrodzenia lub rabatu
Kod i silnik reguł
Wyjaśnienie wyniku lub interpretacja zapytania użytkownika
Wykonanie płatności, zwrotu lub zmiany limitu
Proces transakcyjny z kontrolą uprawnień
Rozpoznanie intencji i przygotowanie danych do zatwierdzenia
Nadanie lub odebranie uprawnień
IAM, reguły ról i zatwierdzenia
Obsługa zgłoszenia w języku naturalnym
Sprawdzenie kompletności wymaganych pól
Walidator schematu
Ekstrakcja pól z nieustrukturyzowanego dokumentu
Prognoza rezygnacji klienta lub popytu
Klasyczne uczenie maszynowe
Opis czynników i przygotowanie komunikacji
Interpretacja dowolnie sformułowanej wiadomości
LLM lub SLM
Klasyfikacja intencji i przekazanie danych do kontrolowanego workflow
W procesie finansowym LLM może odczytać wiadomość, rozpoznać żądanie i przygotować propozycję. Reguły sprawdzają saldo, limity, status klienta i wymagane zgody. System transakcyjny wykonuje operację po spełnieniu warunków. Każda warstwa realizuje zadanie, dla którego można określić jasne kryteria poprawności.
7. Jak dobrać AI do procesu? Cztery kryteria oceny
Wstępną kwalifikację można przeprowadzić w czasie krótkiego warsztatu. Osoba odpowiedzialna za proces ocenia go w czterech obszarach, przyznając od 0 do 3 punktów w każdym z nich. Poszczególne oceny pomagają określić wymagania wobec modelu, integracji, zabezpieczeń i infrastruktury.
Oś
0
1
2
3
Złożoność interpretacji treści
Stałe pola i reguły
Stały zestaw kategorii
Interpretacja kontekstu
Łączenie informacji i wnioskowanie na podstawie wielu źródeł
Integracja i autonomia
Brak dostępu do systemów
Odczyt jednego źródła
Odczyt wielu źródeł lub przygotowanie danych do zapisania w systemie
Transakcje i dynamiczny wybór narzędzi
Skutek błędu
Łatwo odwracalny
Ograniczony koszt operacyjny
Istotny skutek finansowy, prawny lub wizerunkowy
Skutek krytyczny, nieodwracalny lub dotyczący praw i bezpieczeństwa
Wymagania dotyczące infrastruktury i danych
Zarządzana chmura spełnia wymagania
Wymagany region lub określona retencja
Prywatna sieć albo ścisły limit opóźnienia
Praca offline, w środowisku odizolowanym od sieci, na edge lub bezpośrednio na urządzeniu
Wyniki można czytać w następujący sposób:
Złożoność semantyczna 0-1 i stabilne reguły: kod, workflow, RPA albo klasyczne ML.
Złożoność 2-3, integracja 0-1 i skutek błędu 0-1: firmowy asystent LLM z kontrolą użytkownika.
Złożoność 2-3 oraz integracja 2-3: zintegrowana aplikacja LLM, RAG lub agent.
Złożoność 1-2, wąska domena i presja infrastrukturalna 2-3: SLM jako rozwiązanie do uwzględnienia w testach porównawczych.
Skutek błędu 2-3: zatwierdzenie przez uprawnioną osobę, zabezpieczenia oparte na z góry ustalonych regułach i pełny rejestr działań, niezależnie od klasy modelu.
Tabela pomaga wybrać rozwiązania do pilotażu. Ostateczną decyzję podejmuje się po porównaniu ich wyników na tym samym zbiorze rzeczywistych przypadków.
8. ChatGPT, zintegrowany LLM, SLM i automatyzacja: przykłady zastosowań w firmie
Przykładowy proces
Rekomendowana architektura
Najważniejszy KPI
Kontrola człowieka
Pierwsza wersja treści marketingowej
Firmowy asystent LLM
Mediana oszczędności czasu i odsetek zaakceptowanych wyników
Akceptacja każdej publikacji
Podsumowanie spotkania i lista działań
Firmowy asystent z dostępem do zatwierdzonego źródła
Kompletność zadań i liczba korekt
Weryfikacja właścicieli i terminów
Odpowiedzi na pytania o procedury wewnętrzne
Zintegrowany LLM z RAG i cytowaniem źródeł
Odsetek odpowiedzi opartych na źródłach i poprawność odwołań do źródeł
Eskalacja przy braku źródła
Klasyfikacja zgłoszeń do stałych kolejek
SLM lub klasyfikator, LLM dla wyjątków
Macro-F1 i odsetek wykrytych zgłoszeń priorytetowych
Weryfikacja przypadków budzących wątpliwości
Analiza umów według firmowej listy ryzyk
Zintegrowany LLM z RAG, regułami i logami
Odsetek wykrytych oraz przeoczonych klauzul ryzykownych
Decyzja prawnika
Ekstrakcja pól z jednego typu faktury
OCR, klasyczne ML lub SLM oraz walidator reguł
Dokładność na poziomie pola i koszt przetworzenia dokumentu
Kontrola wyjątków
Przygotowanie oferty na podstawie CRM i cennika
Zintegrowany LLM, RAG i pobieranie cen według z góry ustalonych reguł
Czas przygotowania i odsetek korekt handlowych
Akceptacja ceny i warunków
Sprawdzenie prawa do zwrotu
Reguły procesu
Zgodność z polityką i czas decyzji
Obsługa wyjątków
Wykonanie zwrotu pieniędzy
Workflow transakcyjny i autoryzacja
100% zgodności księgowej i pełny audyt
Zależna od kwoty i ryzyka
Lokalna analiza komunikatów maszyny
SLM lub model specjalistyczny na edge
Czas odpowiedzi p95, odsetek wykrytych alarmów i dostępność bez połączenia z internetem
Eskalacja alarmów krytycznych
Odebranie dostępu odchodzącemu pracownikowi
IAM i deterministyczny workflow
Kompletność odebranych uprawnień
Zatwierdzenie według polityki
Wieloetapowa obsługa sprawy klienta
Agent AI z ograniczonym zestawem narzędzi
Skuteczność realizacji zadań, poprawność użycia narzędzi i odsetek spraw przekazanych pracownikowi
Punkty zatwierdzenia dla działań o wysokim wpływie
9. Jak mierzyć efekty wdrożenia AI? Wskaźniki jakości, czasu i kosztów
Pomiar zaczyna się od obecnego procesu. Badanie Generative AI at Work, obejmujące 5 179 pracowników obsługi klienta, wykazało średni wzrost liczby rozwiązanych spraw na godzinę o 14%. Największą poprawę odnotowano u osób mniej doświadczonych. Tak zdefiniowana produktywność ma jasny licznik, mianownik i grupę odniesienia. Podobnej precyzji potrzebuje firmowy pilotaż.
Obszar
Wskaźnik
Sposób pomiaru
Skala
Wolumen spraw
Liczba przypadków miesięcznie, sezonowość i okresy największego obciążenia
Czas
Czas obsługi sprawy
Średnia, mediana i p90 przed wdrożeniem oraz po nim
Jakość
Task success rate
Odsetek przypadków spełniających wszystkie kryteria poprawnego wykonania zadania
Użyteczność
Odsetek wyników przyjętych bez zmian merytorycznych
Odsetek wyników przyjętych bez zmiany merytorycznej
Kontrola
Odsetek decyzji AI zmienionych przez pracownika
Odsetek decyzji lub propozycji zmienionych przez pracownika
Ryzyko
Częstotliwość błędów krytycznych
Liczba błędów krytycznych na 1 000 lub 10 000 przypadków
Klasyfikacja
Precyzja, czułość i miara F1
Osobno dla każdej ważnej klasy, zwłaszcza rzadkich zdarzeń
RAG
Zgodność odpowiedzi ze źródłami
Odsetek twierdzeń wspartych wskazanym, aktualnym źródłem
Agent
Poprawność wyboru narzędzi i przekazywanych parametrów
Poprawny wybór narzędzia oraz poprawność przekazanych parametrów
Automatyzacja
Odsetek spraw obsłużonych w pełni automatycznie
Odsetek spraw zakończonych bez ręcznej interwencji
Wydajność
Czas od rozpoczęcia zadania do uzyskania ostatecznego wyniku
p50 i p95 od rozpoczęcia do ostatecznego wyniku
Ekonomia
Koszt poprawnie zakończonego zadania
Pełny koszt podzielony przez liczbę poprawnych rezultatów
Stabilność
Zmiany jakości działania systemu w czasie
Zmiana jakości według czasu, języka, kategorii i typu użytkownika
Google Cloud wskazuje koszt poprawnie zakończonego zadania jako kluczowy miernik agentów AI działających w rzeczywistych procesach biznesowych. Model kosztujący 0,10 USD na uruchomienie i osiągający 50% skuteczności generuje sam koszt wywołań na poziomie 0,20 USD na poprawny wynik. Do rachunku dochodzą weryfikacja przez pracownika, ponowne próby, integracje, monitoring oraz koszt błędów.
10. Jak obliczyć ROI wdrożenia LLM lub SLM?
Pełny koszt rozwiązania powinien obejmować budowę i integrację, model lub API, infrastrukturę, monitoring, aktualizacje, weryfikacja przez pracownika, poprawki oraz oczekiwaną stratę wynikającą z błędów.
Koszt poprawnie zakończonego zadania:
C_success = (koszt budowy przypisany do okresu + model/API + infrastruktura + monitoring + kontrola człowieka + poprawki + oczekiwana strata błędów) / liczba poprawnie zakończonych zadań
Roczna korzyść:
Korzyść = oszczędzony czas pracy + uniknięte poprawki i błędy + dodatkowa marża + uniknięte kary SLA
ROI:
ROI = (Korzyść – TCO rozwiązania AI) / TCO rozwiązania AI × 100%
Załóżmy, że zespół klasyfikuje 20 000 zgłoszeń miesięcznie. Jedno zgłoszenie zajmuje średnio 4 minuty, a pełny koszt godziny pracy wynosi 120 zł. Miesięczny koszt ręcznej klasyfikacji wynosi około 160 000 zł. W pilotażu system osiąga 88% wyników zaakceptowanych bez korekty, weryfikacja jednego wyniku trwa średnio 45 sekund, poprawa pozostałych przypadków zajmuje 3 minuty, a miesięczne koszty modelu, infrastruktury, utrzymania i amortyzowanego wdrożenia wynoszą 51 000 zł.
przegląd wszystkich przypadków: około 30 000 zł,
poprawa 12% przypadków: około 14 400 zł,
model, infrastruktura, utrzymanie i wdrożenie: 51 000 zł,
łączny koszt procesu po wdrożeniu: około 95 400 zł,
miesięczna różnica kosztu: około 64 600 zł, czyli 40,4%.
To przykład metodologiczny z założonymi wartościami. W analizie opłacalności rzeczywistego wdrożenia trzeba uwzględnić zmianę kosztu błędów, sezonowość, czas przestojów, koszt obsługi wyjątków oraz tempo, w jakim pracownicy zaczynają korzystać z rozwiązania. Dla procesu generującego przychód rachunek powinien uwzględniać również zmianę marży, współczynnika konwersji albo wskaźnika utrzymania klientów
11. Jak przeprowadzić mierzalny pilotaż LLM lub SLM?
Zapisz punkt odniesienia. Zmierz wolumen, czas, jakość, błędy, eskalacje i koszt obecnej metody przez co najmniej jeden pełny cykl biznesowy.
Przygotuj zestaw przypadków testowych. Uwzględnij typowe zadania, trudne i rzadkie sytuacje, przypadki na granicy dopuszczalnych warunków oraz próby celowego wprowadzenia systemu w błąd. Google Cloud zaleca własny zbiór odzwierciedlający pełne spektrum użycia.
Ustal progi przed testem. Zapisz minimalną jakość, maksymalny koszt, dopuszczalną latencję, limit błędów krytycznych i zasady eskalacji.
Porównaj kilka wariantów. Uwzględnij obecny proces, mocny LLM, mniejszy model oraz architekturę hybrydową.
Uruchom system w trybie obserwacyjnym (shadow mode). AI przygotowuje wyniki równolegle do dotychczasowego procesu. Decyzje i działania nadal przebiegają według obowiązujących zasad. Pozwala to wykryć błędy przed dopuszczeniem AI do obsługi rzeczywistych operacji.
Uruchom system w ograniczonym zakresie. Rozpocznij od propozycji i zatwierdzeń. Zakres automatycznych działań rozszerzaj na podstawie wyników.
Monitoruj jakość działania. Ponawiaj testy po zmianie modelu, instrukcji dla AI, narzędzi, źródeł danych, reguł lub rodzaju przetwarzanych materiałów.
11.1 Ile przypadków testowych potrzeba do oceny LLM lub SLM?
Dla wskaźnika wyrażonego jako odsetek, przy poziomie ufności 95% i marginesie błędu +/-5 punktów procentowych, konserwatywna wielkość próby wynosi około 385 niezależnych przypadków. Margines +/-3 punkty procentowe wymaga około 1 068 przypadków. Próba reprezentatywna powinna zostać uzupełniona osobnym zestawem przypadków krytycznych i brzegowych.
Przy rzadkich błędach istotna jest tak zwana reguła trzech. Jeżeli w 300 testach nie pojawi się żaden błąd krytyczny, przybliżona górna granica jego rzeczywistego prawdopodobieństwa na poziomie ufności 95% nadal wynosi około 1%. Zero błędów w 3 000 testów obniża tę granicę do około 0,1%. W procesach wysokiego ryzyka potrzebne są więc znacznie większe zbiory oraz testy ukierunkowane na konkretne zagrożenia.
11.2 Kiedy zakończyć pilotaż AI i uruchomić system w firmie? Przykładowe kryteria
Proces
Przykładowe kryteria przejścia do produkcji
odsetek przypisań zmienionych przez pracownika do 8%
Macro-F1 co najmniej 0,90; recall zgłoszeń priorytetowych co najmniej 0,99; override rate do 8%; p95 do 2 sekund
Wewnętrzna baza wiedzy
Acceptance rate co najmniej 85%; poprawność cytowań co najmniej 98%; brak niepopartych twierdzeń w zestawie krytycznym; p95 do 8 sekund
Projekt oferty
Mediana czasu niższa o co najmniej 30%; co najmniej 75% materiałów przyjętych z drobnymi zmianami; 100% cen pobranych z autoryzowanego źródła; zatwierdzenie człowieka dla każdej oferty
Podane wartości są przykładem konstrukcji kryteriów. Właściciel procesu ustala progi zgodnie z kosztem błędu, wymaganą jakością i tolerancją ryzyka organizacji.
12. Jak dobrać zakres nadzoru człowieka do ryzyka związanego z AI?
NIST definiuje ryzyko jako połączenie prawdopodobieństwa zdarzenia i skali jego konsekwencji. Ta zasada pozwala przełożyć ogólne obawy związane z AI na mierzalny model: częstotliwość błędów, wartość środków lub zasobów narażonych na stratę, możliwość cofnięcia działania, czas wykrycia błędu i koszt jego naprawy
W skonsolidowanym tekście unijnego AI Act wymagania dla systemów wysokiego ryzyka obejmują ciągłe zarządzanie ryzykiem, odpowiedni poziom dokładności, odporności i cyberbezpieczeństwa oraz skuteczny nadzór człowieka. Środki nadzoru mają być proporcjonalne do ryzyka, poziomu autonomii i kontekstu użycia. Testy powinny korzystać z uprzednio zdefiniowanych metryk i progów właściwych dla zamierzonego zastosowania.
W praktyce biznesowej oznacza to przypisanie konkretnej osoby do zatwierdzania, monitorowania i reagowania. Interfejs powinien pokazywać źródła, wykonane działania i poziom niepewności, a użytkownik musi mieć możliwość zatrzymania procesu. Ryzyko poważnych konsekwencji błędu uzasadnia ograniczenie uprawnień modelu, dodatkowe sprawdzanie wyników i dłuższe testy w trybie obserwacyjnym. Klasyfikację regulacyjną należy ustalić osobno dla zamierzonego zastosowania i roli organizacji.
13. Jak połączyć LLM, SLM i reguły w jednym procesie biznesowym?
Połączenie kilku technologii pozwala dopasować sposób obsługi do poszczególnych etapów procesu. Przykładowo SLM rozpoznaje temat zgłoszenia klienta, a LLM przygotowuje odpowiedź na podstawie historii kontaktu i dokumentów pobranych przez RAG. Gdy sprawa dotyczy zwrotu pieniędzy, system sprawdza warunki i limity zgodnie z ustalonymi regułami, a następnie kieruje operację do realizacji lub zatwierdzenia przez uprawnionego pracownika. Tak zaprojektowana obsługa łączy automatyzację z kontrolą decyzji mających skutki finansowe.
W TTMS pomożemy Ci ocenić, gdzie podobne rozwiązanie przyniesie największą korzyść. Zaczniemy od zadań, które pochłaniają najwięcej czasu: powtarzalnych czynności, wyszukiwania informacji czy poprawiania błędów. Podczas konsultacji przeanalizujemy przebieg pracy, dostępne dane i wykorzystywane systemy. Na tej podstawie zaproponujemy technologię i zakres pilotażu, a wspólnie z Tobą ustalimy oczekiwane efekty oraz sposób pomiaru jakości, czasu i kosztów.
Chcesz wybrać pierwszy proces do usprawnienia? Umów się z nami na konsultację dotyczącą wdrożenia AI.
Źródła
Eurostat, 20% of EU enterprises use AI technologies, 11 grudnia 2025.
Fabrizio Dell’Acqua et al., Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality, Organization Science.
Erik Brynjolfsson, Danielle Li, Lindsey Raymond, Generative AI at Work, NBER Working Paper 31161, 2023.
Joel Becker, Nate Rush, Beth Barnes, David Rein, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, METR, 10 lipca 2025.
Microsoft Azure, What Are Small Language Models (SLMs)?.
Microsoft Azure, Boost processing performance by combining AI models, 8 stycznia 2025.
OpenAI, Enterprise privacy at OpenAI.
Google Cloud, The KPIs that actually matter for production AI agents, 26 lutego 2026.
NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, lipiec 2024.
Unia Europejska, Rozporządzenie (UE) 2024/1689, tekst skonsolidowany z 27 lipca 2026.
OWASP GenAI Security Project, LLM06:2025 Excessive Agency, 2025.
FAQ
Czy do pracy na danych firmowych trzeba uruchamiać własny model AI?
Własny model jest jednym z dostępnych wariantów. Firmy mogą korzystać z zatwierdzonego środowiska biznesowego, zarządzanego API, prywatnej chmury, wydzielonej infrastruktury lub modelu działającego lokalnie. Wybór zależy od klasy danych, lokalizacji przetwarzania, retencji, szyfrowania, tożsamości użytkowników, wymogów branżowych i umowy z dostawcą. Przykładowo OpenAI deklaruje brak domyślnego trenowania na danych klientów biznesowych i oferuje dodatkowe mechanizmy kontroli retencji dla kwalifikujących się klientów API. Organizacja powinna udokumentować przepływ danych dla konkretnej konfiguracji, ponieważ nazwa modelu nie opisuje całej architektury bezpieczeństwa.
Czy RAG może zastąpić fine-tuning modelu na danych firmy?
RAG i fine-tuning rozwiązują różne problemy. RAG pobiera aktualne informacje z kontrolowanego źródła w momencie tworzenia odpowiedzi, dzięki czemu dobrze pasuje do baz wiedzy, procedur, dokumentacji i treści często aktualizowanych. Fine-tuning dostosowuje zachowanie modelu do przykładów, stylu, formatu albo wyspecjalizowanego zadania. Dokumentacja AWS porównująca RAG i fine-tuning rekomenduje rozpoczęcie systemu pytań i odpowiedzi na własnych dokumentach od RAG, zwłaszcza gdy ważne są aktualność i odwołania do źródeł. Oba mechanizmy mogą działać razem, jeśli proces wymaga zarówno aktualnej wiedzy, jak i stabilnego zachowania domenowego.
Czy jeden proces może korzystać jednocześnie z LLM i SLM?
Tak. Router może kierować typowe, dobrze rozpoznane sprawy do SLM, a przypadki złożone do większego LLM. Trzecia ścieżka prowadzi do człowieka, gdy system wykryje brak danych, niską pewność albo wysoki poziom ryzyka. Innym wariantem jest podział procesu według funkcji: SLM klasyfikuje dokument, LLM przygotowuje wyjaśnienie, kod oblicza wartości, a workflow zapisuje zatwierdzoną decyzję. Taki układ pozwala kontrolować koszty i czas reakcji przy zachowaniu dostępu do większych możliwości w trudniejszych sprawach.
Ile przykładów potrzeba do pilotażu LLM lub SLM?
Liczba zależy od oczekiwanej precyzji pomiaru i rzadkości błędów. Dla odsetka skutecznych odpowiedzi próba około 385 niezależnych przypadków daje przybliżony margines +/-5 punktów procentowych przy poziomie ufności 95% w wariancie konserwatywnym. Margines +/-3 punkty wymaga około 1 068 przypadków. Losowa próba powinna odzwierciedlać rzeczywisty wolumen, języki, kanały i typy użytkowników. Osobny zestaw powinien obejmować przypadki krytyczne, brzegowe, rzadkie oraz próby manipulacji systemem.
Jak często trzeba ponownie testować aplikację opartą na modelu językowym?
Pełna ewaluacja powinna zostać uruchomiona po zmianie modelu, wersji promptu, narzędzia, uprawnień, źródła danych, reguł biznesowych lub formatu wejścia. Produkcja wymaga również ciągłego monitorowania najważniejszych KPI oraz cyklicznego testu regresji. Częstotliwość zależy od ryzyka i tempa zmian procesu. Aplikacja obsługująca treści marketingowe może mieć inny harmonogram niż system wspierający decyzje finansowe. Praktycznym rozwiązaniem jest automatyczny test przy każdej zmianie technicznej, miesięczny przegląd trendów oraz kwartalna ewaluacja biznesowa, z krótszym cyklem dla zastosowań wysokiego ryzyka.
Czytaj więcej