W 2025 roku sztucznej inteligencji używało 20% przedsiębiorstw w Unii Europejskiej, wobec 13,5% rok wcześniej. W Polsce odsetek ten wynosił 8,4%. Najczęstszym zastosowaniem była analiza języka pisanego, z której korzystało 11,8% firm objętych badaniem. Autorzy badania opublikowanego w 2026 roku w Organization Science opisali to zjawisko jako „jagged technological frontier”, czyli nierównomierną granicę możliwości AI: zadania o podobnym poziomie trudności dla człowieka mogą sprawiać modelowi zupełnie różne trudności. Kolejny etap wymaga odpowiedzi na bardziej precyzyjne pytanie: jaka forma AI pasuje do konkretnego zadania?
W eksperymencie przeprowadzonym wśród 758 konsultantów osoby korzystające z GPT-4 wykonały 12,2% więcej zadań i ukończyły je średnio o 25,1% szybciej, gdy zadania mieściły się w zakresie możliwości modelu. Przy złożonym zadaniu wykraczającym poza ten zakres prawdopodobieństwo poprawnego rozwiązania spadło o 19 punktów procentowych. Autorzy badania opublikowanego w 2026 roku w Organization Science nazwali tę nieregularną granicę możliwości AI „jagged technological frontier”.
Efektywność wynika więc z dopasowania technologii do zadania, danych, ryzyka i sposobu kontroli wyniku. Dla jednego procesu właściwym rozwiązaniem będzie firmowy asystent LLM. Drugi będzie wymagał aplikacji połączonej z CRM, bazą wiedzy i systemem uprawnień. W trzecim sprawdzi się niewielki model działający lokalnie. Operacje o jednoznacznych regułach można powierzyć kodowi, silnikom reguł lub robotyzacji procesów biznesowych (RPA). Klasyczne uczenie maszynowe sprawdza się między innymi w prognozowaniu i klasyfikacji danych.

1. LLM i SLM w firmie: wybór modelu, integracji i miejsca przetwarzania danych
Określenia „LLM”, „wdrożony LLM” i „zamknięty SLM” łączą kilka warstw technologii. W praktyce biznesowej warto rozdzielić cztery decyzje:
- Sposób pracy: czy pracownik rozmawia z gotowym asystentem, czy proces uruchamia się automatycznie?
- Zakres integracji: czy rozwiązanie pracuje na materiałach przekazanych przez użytkownika, czy pobiera dane i wykonuje działania w systemach firmy?
- Klasa modelu: czy zadanie wymaga szerokich możliwości dużego modelu językowego, czy wystarczy wyspecjalizowany SLM?
- Miejsce przetwarzania: czy model działa jako usługa chmurowa, w wydzielonym środowisku, w prywatnej chmurze, lokalnie albo bezpośrednio na urządzeniu?
Skrót SLM (Small Language Model) oznacza mały model językowy, zwykle wymagający mniej zasobów obliczeniowych. Określenie „system zamknięty” wymaga doprecyzowania: może odnosić się do ograniczonego dostępu, odizolowanego środowiska lub przetwarzania danych we własnej infrastrukturze. Duży LLM może działać w środowisku prywatnym, a SLM może być udostępniany przez publiczne API. Sama wielkość modelu nie określa warunków bezpieczeństwa danych.
2. Sześć sposobów wykorzystania AI w procesach biznesowych
| Wariant | Jak działa | Najlepsze dopasowanie | Główny miernik |
|---|---|---|---|
| Firmowy asystent LLM | Pracownik zleca zadanie i sprawdza wynik w zatwierdzonym środowisku, np. ChatGPT Business lub Enterprise | Analiza, redagowanie, podsumowanie, przygotowanie wariantów, praca ad hoc | Oszczędność czasu na zadanie po uwzględnieniu weryfikacji i poprawek |
| Zintegrowana aplikacja LLM lub RAG | Model korzysta z firmowych źródeł, reguł, uprawnień i integracji | Powtarzalne procesy oparte na dokumentach, wiedzy i danych z systemów | Koszt poprawnie zakończonej sprawy |
| Agent AI | Rozwiązanie planuje kolejne kroki, wybiera narzędzia i realizuje cel w określonym zakresie | Wieloetapowe procesy z wyjątkami i dynamiczną ścieżką | Odsetek poprawnie wykonanych zadań |
| SLM | Mniejszy model obsługuje wąski zakres zadań w chmurze, na serwerze firmy, na edge albo na urządzeniu | Duża liczba zadań, stały zakres tematyczny, krótki czas odpowiedzi, praca offline | Jakość w porównaniu z LLM przy określonym koszcie i limicie czasu odpowiedzi p95 |
| Prywatne lub lokalne wdrożenie | LLM albo SLM działa w kontrolowanym środowisku, prywatnej chmurze, sieci firmy lub na urządzeniu | Wymogi lokalizacji danych, ciągłości działania, łączności, infrastruktury lub polityki bezpieczeństwa | Zgodność z wymaganiami, jakość, dostępność i całkowity koszt posiadania i użytkowania rozwiązania (TCO) |
| Reguły, RPA lub klasyczne ML | Przebieg procesu jest zapisany w kodzie, warunkach, modelu predykcyjnym lub maszynie stanów | Obliczenia, transakcje, stałe ścieżki i jednoznaczne decyzje | Dokładność, powtarzalność i kompletność śladu audytowego |
W dojrzałym wdrożeniu warianty te często współpracują. Model językowy interpretuje wiadomość, reguły sprawdzają warunki, aplikacja pobiera dane, człowiek zatwierdza działanie, a system transakcyjny zapisuje wynik.
3. Do jakich zadań wykorzystać ChatGPT lub innego asystenta LLM?
Gotowy asystent LLM dobrze wspiera zadania, w których pracownik odpowiada za sprawdzenie i wykorzystanie wyniku. Użytkownik inicjuje pracę, przekazuje kontekst, ocenia odpowiedź i decyduje o jej wykorzystaniu. Wynik ma formę projektu, rekomendacji, analizy lub materiału roboczego.
Do tej grupy należą między innymi:
- przygotowanie pierwszej wersji raportu, wiadomości, prezentacji lub artykułu,
- streszczenie dokumentów i korespondencji,
- porównanie kilku materiałów dostarczonych przez użytkownika,
- tworzenie pytań, scenariuszy i wariantów rozwiązania,
- tłumaczenie treści przeznaczonych do dalszej kontroli,
- eksploracyjna analiza danych i wyjaśnianie wyników,
- porządkowanie notatek ze spotkania,
- przygotowanie projektu procedury lub planu działania.
Taki sposób pracy sprawdza się w procesach, gdy każda odpowiedź przechodzi kontrolę człowieka, rezultat można łatwo poprawić lub wycofać, a zadanie nie wymaga automatycznego zapisu w systemie krytycznym. Duża zmienność materiału i potrzeba pracy językowej dodatkowo zwiększają użyteczność LLM.
Bezpieczeństwo zależy od zatwierdzonego produktu i konfiguracji. OpenAI deklaruje, że dane z ChatGPT Business, ChatGPT Enterprise i API nie są domyślnie wykorzystywane do trenowania modeli. Dokumentacja kontroli danych API opisuje również oddzielne zasady retencji, w tym standardowe rejestry służące monitorowaniu nadużyć oraz opcję Zero Data Retention dla klientów spełniających określone warunki. Przed rozpoczęciem pracy organizacja powinna sprawdzić klasyfikację danych, umowę, region przetwarzania, retencję, uprawnienia administratorów i zasady korzystania z połączonych aplikacji. Więcej przykładów takiej pracy zawiera zestawienie 15 integracji ChatGPT z aplikacjami biznesowymi.

3.1 Jak mierzyć oszczędność czasu i jakość pracy z LLM?
Badanie pracowników wyłącznie za pomocą ankiety może zawyżać efekt. W eksperymencie METR doświadczeni programiści wykonywali badane zadania z narzędziami AI o 19% dłużej, a po eksperymencie nadal oceniali, że AI przyspieszyła ich pracę o 20%. Badanie obejmowało 16 osób i 246 rzeczywistych zadań w znanych im repozytoriach, więc jego wynik dotyczy tego konkretnego środowiska. Metodologiczny wniosek ma szersze zastosowanie: przed wdrożeniem trzeba zmierzyć rzeczywisty czas i jakość.
Dla asystenta LLM warto monitorować medianę czasu wykonania zadania, udział wyników zaakceptowanych bez zmian, średni czas poprawek, jakość ocenianą według jednolitych kryteriów, częstotliwość użycia oraz liczbę przypadków, w których użytkownik wrócił do poprzedniej metody pracy.
4. Kiedy zintegrować LLM z systemami firmy, a kiedy wdrożyć agenta AI?
Integracja staje się uzasadniona, gdy wartość procesu zależy od aktualnych danych firmy, powtarzalnego przebiegu i współpracy kilku systemów. Model otrzymuje wtedy kontrolowany dostęp do dokumentów, bazy wiedzy, CRM, ERP, systemu zgłoszeń albo poczty. Aplikacja weryfikuje tożsamość użytkownika, kontroluje zakres udostępnianych danych, ustala format odpowiedzi, sprawdza wyniki, rejestruje działania i kieruje wybrane operacje do zatwierdzenia.
Typowa zintegrowana aplikacja AI obejmuje pięć warstw:
- Wejście: wiadomość, dokument, formularz, zdarzenie systemowe lub rekord.
- Kontekst: dane pobrane zgodnie z uprawnieniami, często z wykorzystaniem RAG.
- Model: LLM albo SLM dobrany do konkretnego etapu.
- Walidacja: reguły, kontrola kompletności, sprawdzenie źródeł, klasyfikacja ryzyka.
- Wynik: odpowiedź dla człowieka, projekt rekordu albo zatwierdzone działanie w systemie.
Takiej architektury wymagają między innymi wyszukiwanie odpowiedzi w wewnętrznej bazie wiedzy, analiza umów według firmowej listy ryzyk, przygotowanie oferty na podstawie CRM i cennika, klasyfikowanie zgłoszeń, wdrażanie nowych pracowników, weryfikacja dokumentów zakupowych oraz tworzenie odpowiedzi na podstawie historii klienta. Mechanizm RAG pozwala pobierać aktualne fragmenty zatwierdzonych źródeł i dołączać je do kontekstu odpowiedzi.
Agent AI jest kolejnym poziomem integracji. Otrzymuje cel, dobiera narzędzia i planuje sekwencję działań. Według aktualnych wytycznych Google Cloud dotyczących architektury agentowej agenci pasują do otwartych, wieloetapowych problemów wymagających użycia danych zewnętrznych i pewnego zakresu autonomii. Do przygotowania pojedynczego streszczenia lub tłumaczenia zwykle wystarcza aplikacja o z góry ustalonej sekwencji działań.
Rolę zaawansowanego modelu jako warstwy wnioskowania połączonej z narzędziami, danymi i uprawnieniami szerzej opisujemy w artykule GPT-5.5 dla biznesu: nowa era agentów AI.
Zakres samodzielnych działań agenta można rozszerzać, gdy wyniki testów potwierdzają wymaganą skuteczność i bezpieczeństwo. Uprawnienia agenta warto ograniczyć do funkcji potrzebnych w danym procesie, rozdzielić odczyt od zapisu i wprowadzić zatwierdzenie działań o istotnych skutkach dla firmy lub klienta. OWASP określa nadmierną funkcjonalność, zbyt szerokie uprawnienia i nadmierną autonomię jako trzy główne źródła ryzyka Excessive Agency. Zasada najmniejszych uprawnień ogranicza skutki błędnej interpretacji, wygenerowania nieprawdziwej informacji lub ataku polegającego na podsunięciu modelowi złośliwych instrukcji (prompt injection).
5. Do jakich procesów biznesowych sprawdzi się mały model językowy SLM?
Small Language Model wykorzystuje mniej parametrów i zasobów obliczeniowych niż duży model językowy. Według Microsoft Azure sprzyja to krótszemu czasowi odpowiedzi, niższemu zapotrzebowaniu na infrastrukturę oraz przetwarzaniu danych blisko miejsca ich powstawania (edge computing), np. na urządzeniach przemysłowych. Wyspecjalizowany SLM może sprawdzić się w zadaniach o stałej tematyce, przewidywalnych danych wejściowych i jasno określonym wyniku.
Warto przetestować SLM, gdy proces spełnia kilka z poniższych warunków:
- stały zestaw kategorii, intencji, pól albo typów odpowiedzi,
- wysoki i przewidywalny wolumen wywołań,
- krótki wymagany czas reakcji mierzony jako p95, czyli wartość, której nie przekracza 95% czasów odpowiedzi,
- ograniczone zasoby sprzętowe,
- potrzeba pracy offline lub bezpośrednio na urządzeniu,
- dostęp do danych z danego obszaru działalności oraz zestawu wzorcowych odpowiedzi,
- możliwość przekazywania trudnych przypadków do większego modelu lub człowieka.
Przykładem może być klasyfikacja zgłoszeń według 30 stałych kategorii, rozpoznawanie intencji rozmówcy, odczytywanie wartości pól z jednego typu dokumentu, generowanie krótkich odpowiedzi w ściśle określonym zakresie tematycznym albo lokalna analiza komunikatów na urządzeniu przemysłowym.
O wyborze decyduje wynik testu na danych firmy. SLM powinien osiągnąć wymagany poziom jakości, czasu odpowiedzi i kosztu poprawnie obsłużonej sprawy. Firma może przykładowo wymagać, aby mniejszy model utrzymywał co najmniej 98% jakości referencyjnego LLM, obniżał koszt poprawnego wyniku o co najmniej 20% i mieścił się w limicie p95. Są to przykładowe progi decyzyjne, które właściciel procesu ustala przed pilotażem.

5.1 Kiedy wdrożyć LLM lub SLM lokalnie albo w prywatnej chmurze?
Prywatne lub lokalne wdrożenie może wynikać z wymagań dotyczących suwerenności danych, polityki bezpieczeństwa, ciągłości pracy, opóźnień sieciowych albo środowiska bez dostępu do internetu. Takie wdrożenie może wykorzystywać SLM lub większy model. Równocześnie firmowa aplikacja może korzystać z zarządzanego API z szyfrowaniem, kontrolą retencji, odpowiednim regionem i umową dotyczącą danych.
Najbardziej efektywna bywa architektura kaskadowa. Microsoft opisuje model hybrydowy, w którym SLM obsługuje typowe zapytania i przekazuje bardziej złożone przypadki do LLM. W środowisku biznesowym do tej kaskady warto dodać trzecią ścieżkę: przekazanie sprawy pracownikowi, gdy wynik budzi wątpliwości, ryzyko jest wysokie lub brakuje wymaganych danych.
6. Które procesy zautomatyzować za pomocą reguł, RPA lub uczenia maszynowego?
Procesy o stałych regułach wymagają jasno określonej kolejności działań i warunków ich wykonania. Dokumentacja AWS dotycząca orkiestracji rozdziela przepływy regułowe, w których kolejne stany i przejścia są jawnie zapisane, oraz orkiestrację agentową, w której model interpretuje cel i dynamicznie wybiera narzędzia. Obie warstwy mogą działać w jednej aplikacji.
| Proces | Rekomendowany mechanizm | Rola modelu językowego |
|---|---|---|
| Naliczenie podatku, wynagrodzenia lub rabatu | Kod i silnik reguł | Wyjaśnienie wyniku lub interpretacja zapytania użytkownika |
| Wykonanie płatności, zwrotu lub zmiany limitu | Proces transakcyjny z kontrolą uprawnień | Rozpoznanie intencji i przygotowanie danych do zatwierdzenia |
| Nadanie lub odebranie uprawnień | IAM, reguły ról i zatwierdzenia | Obsługa zgłoszenia w języku naturalnym |
| Sprawdzenie kompletności wymaganych pól | Walidator schematu | Ekstrakcja pól z nieustrukturyzowanego dokumentu |
| Prognoza rezygnacji klienta lub popytu | Klasyczne uczenie maszynowe | Opis czynników i przygotowanie komunikacji |
| Interpretacja dowolnie sformułowanej wiadomości | LLM lub SLM | Klasyfikacja intencji i przekazanie danych do kontrolowanego workflow |
W procesie finansowym LLM może odczytać wiadomość, rozpoznać żądanie i przygotować propozycję. Reguły sprawdzają saldo, limity, status klienta i wymagane zgody. System transakcyjny wykonuje operację po spełnieniu warunków. Każda warstwa realizuje zadanie, dla którego można określić jasne kryteria poprawności.
7. Jak dobrać AI do procesu? Cztery kryteria oceny
Wstępną kwalifikację można przeprowadzić w czasie krótkiego warsztatu. Osoba odpowiedzialna za proces ocenia go w czterech obszarach, przyznając od 0 do 3 punktów w każdym z nich. Poszczególne oceny pomagają określić wymagania wobec modelu, integracji, zabezpieczeń i infrastruktury.
| Oś | 0 | 1 | 2 | 3 |
|---|---|---|---|---|
| Złożoność interpretacji treści | Stałe pola i reguły | Stały zestaw kategorii | Interpretacja kontekstu | Łączenie informacji i wnioskowanie na podstawie wielu źródeł |
| Integracja i autonomia | Brak dostępu do systemów | Odczyt jednego źródła | Odczyt wielu źródeł lub przygotowanie danych do zapisania w systemie | Transakcje i dynamiczny wybór narzędzi |
| Skutek błędu | Łatwo odwracalny | Ograniczony koszt operacyjny | Istotny skutek finansowy, prawny lub wizerunkowy | Skutek krytyczny, nieodwracalny lub dotyczący praw i bezpieczeństwa |
| Wymagania dotyczące infrastruktury i danych | Zarządzana chmura spełnia wymagania | Wymagany region lub określona retencja | Prywatna sieć albo ścisły limit opóźnienia | Praca offline, w środowisku odizolowanym od sieci, na edge lub bezpośrednio na urządzeniu |
Wyniki można czytać w następujący sposób:
- Złożoność semantyczna 0-1 i stabilne reguły: kod, workflow, RPA albo klasyczne ML.
- Złożoność 2-3, integracja 0-1 i skutek błędu 0-1: firmowy asystent LLM z kontrolą użytkownika.
- Złożoność 2-3 oraz integracja 2-3: zintegrowana aplikacja LLM, RAG lub agent.
- Złożoność 1-2, wąska domena i presja infrastrukturalna 2-3: SLM jako rozwiązanie do uwzględnienia w testach porównawczych.
- Skutek błędu 2-3: zatwierdzenie przez uprawnioną osobę, zabezpieczenia oparte na z góry ustalonych regułach i pełny rejestr działań, niezależnie od klasy modelu.
Tabela pomaga wybrać rozwiązania do pilotażu. Ostateczną decyzję podejmuje się po porównaniu ich wyników na tym samym zbiorze rzeczywistych przypadków.
8. ChatGPT, zintegrowany LLM, SLM i automatyzacja: przykłady zastosowań w firmie
| Przykładowy proces | Rekomendowana architektura | Najważniejszy KPI | Kontrola człowieka |
|---|---|---|---|
| Pierwsza wersja treści marketingowej | Firmowy asystent LLM | Mediana oszczędności czasu i odsetek zaakceptowanych wyników | Akceptacja każdej publikacji |
| Podsumowanie spotkania i lista działań | Firmowy asystent z dostępem do zatwierdzonego źródła | Kompletność zadań i liczba korekt | Weryfikacja właścicieli i terminów |
| Odpowiedzi na pytania o procedury wewnętrzne | Zintegrowany LLM z RAG i cytowaniem źródeł | Odsetek odpowiedzi opartych na źródłach i poprawność odwołań do źródeł | Eskalacja przy braku źródła |
| Klasyfikacja zgłoszeń do stałych kolejek | SLM lub klasyfikator, LLM dla wyjątków | Macro-F1 i odsetek wykrytych zgłoszeń priorytetowych | Weryfikacja przypadków budzących wątpliwości |
| Analiza umów według firmowej listy ryzyk | Zintegrowany LLM z RAG, regułami i logami | Odsetek wykrytych oraz przeoczonych klauzul ryzykownych | Decyzja prawnika |
| Ekstrakcja pól z jednego typu faktury | OCR, klasyczne ML lub SLM oraz walidator reguł | Dokładność na poziomie pola i koszt przetworzenia dokumentu | Kontrola wyjątków |
| Przygotowanie oferty na podstawie CRM i cennika | Zintegrowany LLM, RAG i pobieranie cen według z góry ustalonych reguł | Czas przygotowania i odsetek korekt handlowych | Akceptacja ceny i warunków |
| Sprawdzenie prawa do zwrotu | Reguły procesu | Zgodność z polityką i czas decyzji | Obsługa wyjątków |
| Wykonanie zwrotu pieniędzy | Workflow transakcyjny i autoryzacja | 100% zgodności księgowej i pełny audyt | Zależna od kwoty i ryzyka |
| Lokalna analiza komunikatów maszyny | SLM lub model specjalistyczny na edge | Czas odpowiedzi p95, odsetek wykrytych alarmów i dostępność bez połączenia z internetem | Eskalacja alarmów krytycznych |
| Odebranie dostępu odchodzącemu pracownikowi | IAM i deterministyczny workflow | Kompletność odebranych uprawnień | Zatwierdzenie według polityki |
| Wieloetapowa obsługa sprawy klienta | Agent AI z ograniczonym zestawem narzędzi | Skuteczność realizacji zadań, poprawność użycia narzędzi i odsetek spraw przekazanych pracownikowi | Punkty zatwierdzenia dla działań o wysokim wpływie |
9. Jak mierzyć efekty wdrożenia AI? Wskaźniki jakości, czasu i kosztów
Pomiar zaczyna się od obecnego procesu. Badanie Generative AI at Work, obejmujące 5 179 pracowników obsługi klienta, wykazało średni wzrost liczby rozwiązanych spraw na godzinę o 14%. Największą poprawę odnotowano u osób mniej doświadczonych. Tak zdefiniowana produktywność ma jasny licznik, mianownik i grupę odniesienia. Podobnej precyzji potrzebuje firmowy pilotaż.
| Obszar | Wskaźnik | Sposób pomiaru |
|---|---|---|
| Skala | Wolumen spraw | Liczba przypadków miesięcznie, sezonowość i okresy największego obciążenia |
| Czas | Czas obsługi sprawy | Średnia, mediana i p90 przed wdrożeniem oraz po nim |
| Jakość | Task success rate | Odsetek przypadków spełniających wszystkie kryteria poprawnego wykonania zadania |
| Użyteczność | Odsetek wyników przyjętych bez zmian merytorycznych | Odsetek wyników przyjętych bez zmiany merytorycznej |
| Kontrola | Odsetek decyzji AI zmienionych przez pracownika | Odsetek decyzji lub propozycji zmienionych przez pracownika |
| Ryzyko | Częstotliwość błędów krytycznych | Liczba błędów krytycznych na 1 000 lub 10 000 przypadków |
| Klasyfikacja | Precyzja, czułość i miara F1 | Osobno dla każdej ważnej klasy, zwłaszcza rzadkich zdarzeń |
| RAG | Zgodność odpowiedzi ze źródłami | Odsetek twierdzeń wspartych wskazanym, aktualnym źródłem |
| Agent | Poprawność wyboru narzędzi i przekazywanych parametrów | Poprawny wybór narzędzia oraz poprawność przekazanych parametrów |
| Automatyzacja | Odsetek spraw obsłużonych w pełni automatycznie | Odsetek spraw zakończonych bez ręcznej interwencji |
| Wydajność | Czas od rozpoczęcia zadania do uzyskania ostatecznego wyniku | p50 i p95 od rozpoczęcia do ostatecznego wyniku |
| Ekonomia | Koszt poprawnie zakończonego zadania | Pełny koszt podzielony przez liczbę poprawnych rezultatów |
| Stabilność | Zmiany jakości działania systemu w czasie | Zmiana jakości według czasu, języka, kategorii i typu użytkownika |
Google Cloud wskazuje koszt poprawnie zakończonego zadania jako kluczowy miernik agentów AI działających w rzeczywistych procesach biznesowych. Model kosztujący 0,10 USD na uruchomienie i osiągający 50% skuteczności generuje sam koszt wywołań na poziomie 0,20 USD na poprawny wynik. Do rachunku dochodzą weryfikacja przez pracownika, ponowne próby, integracje, monitoring oraz koszt błędów.
10. Jak obliczyć ROI wdrożenia LLM lub SLM?
Pełny koszt rozwiązania powinien obejmować budowę i integrację, model lub API, infrastrukturę, monitoring, aktualizacje, weryfikacja przez pracownika, poprawki oraz oczekiwaną stratę wynikającą z błędów.
Koszt poprawnie zakończonego zadania:
C_success = (koszt budowy przypisany do okresu + model/API + infrastruktura + monitoring + kontrola człowieka + poprawki + oczekiwana strata błędów) / liczba poprawnie zakończonych zadań
Roczna korzyść:
Korzyść = oszczędzony czas pracy + uniknięte poprawki i błędy + dodatkowa marża + uniknięte kary SLA
ROI:
ROI = (Korzyść - TCO rozwiązania AI) / TCO rozwiązania AI × 100%
Załóżmy, że zespół klasyfikuje 20 000 zgłoszeń miesięcznie. Jedno zgłoszenie zajmuje średnio 4 minuty, a pełny koszt godziny pracy wynosi 120 zł. Miesięczny koszt ręcznej klasyfikacji wynosi około 160 000 zł. W pilotażu system osiąga 88% wyników zaakceptowanych bez korekty, weryfikacja jednego wyniku trwa średnio 45 sekund, poprawa pozostałych przypadków zajmuje 3 minuty, a miesięczne koszty modelu, infrastruktury, utrzymania i amortyzowanego wdrożenia wynoszą 51 000 zł.
- przegląd wszystkich przypadków: około 30 000 zł,
- poprawa 12% przypadków: około 14 400 zł,
- model, infrastruktura, utrzymanie i wdrożenie: 51 000 zł,
- łączny koszt procesu po wdrożeniu: około 95 400 zł,
- miesięczna różnica kosztu: około 64 600 zł, czyli 40,4%.
To przykład metodologiczny z założonymi wartościami. W analizie opłacalności rzeczywistego wdrożenia trzeba uwzględnić zmianę kosztu błędów, sezonowość, czas przestojów, koszt obsługi wyjątków oraz tempo, w jakim pracownicy zaczynają korzystać z rozwiązania. Dla procesu generującego przychód rachunek powinien uwzględniać również zmianę marży, współczynnika konwersji albo wskaźnika utrzymania klientów
11. Jak przeprowadzić mierzalny pilotaż LLM lub SLM?
- Zapisz punkt odniesienia. Zmierz wolumen, czas, jakość, błędy, eskalacje i koszt obecnej metody przez co najmniej jeden pełny cykl biznesowy.
- Przygotuj zestaw przypadków testowych. Uwzględnij typowe zadania, trudne i rzadkie sytuacje, przypadki na granicy dopuszczalnych warunków oraz próby celowego wprowadzenia systemu w błąd. Google Cloud zaleca własny zbiór odzwierciedlający pełne spektrum użycia.
- Ustal progi przed testem. Zapisz minimalną jakość, maksymalny koszt, dopuszczalną latencję, limit błędów krytycznych i zasady eskalacji.
- Porównaj kilka wariantów. Uwzględnij obecny proces, mocny LLM, mniejszy model oraz architekturę hybrydową.
- Uruchom system w trybie obserwacyjnym (shadow mode). AI przygotowuje wyniki równolegle do dotychczasowego procesu. Decyzje i działania nadal przebiegają według obowiązujących zasad. Pozwala to wykryć błędy przed dopuszczeniem AI do obsługi rzeczywistych operacji.
- Uruchom system w ograniczonym zakresie. Rozpocznij od propozycji i zatwierdzeń. Zakres automatycznych działań rozszerzaj na podstawie wyników.
- Monitoruj jakość działania. Ponawiaj testy po zmianie modelu, instrukcji dla AI, narzędzi, źródeł danych, reguł lub rodzaju przetwarzanych materiałów.
11.1 Ile przypadków testowych potrzeba do oceny LLM lub SLM?
Dla wskaźnika wyrażonego jako odsetek, przy poziomie ufności 95% i marginesie błędu +/-5 punktów procentowych, konserwatywna wielkość próby wynosi około 385 niezależnych przypadków. Margines +/-3 punkty procentowe wymaga około 1 068 przypadków. Próba reprezentatywna powinna zostać uzupełniona osobnym zestawem przypadków krytycznych i brzegowych.
Przy rzadkich błędach istotna jest tak zwana reguła trzech. Jeżeli w 300 testach nie pojawi się żaden błąd krytyczny, przybliżona górna granica jego rzeczywistego prawdopodobieństwa na poziomie ufności 95% nadal wynosi około 1%. Zero błędów w 3 000 testów obniża tę granicę do około 0,1%. W procesach wysokiego ryzyka potrzebne są więc znacznie większe zbiory oraz testy ukierunkowane na konkretne zagrożenia.
11.2 Kiedy zakończyć pilotaż AI i uruchomić system w firmie? Przykładowe kryteria
| Proces | Przykładowe kryteria przejścia do produkcji |
|---|---|
| odsetek przypisań zmienionych przez pracownika do 8% | Macro-F1 co najmniej 0,90; recall zgłoszeń priorytetowych co najmniej 0,99; override rate do 8%; p95 do 2 sekund |
| Wewnętrzna baza wiedzy | Acceptance rate co najmniej 85%; poprawność cytowań co najmniej 98%; brak niepopartych twierdzeń w zestawie krytycznym; p95 do 8 sekund |
| Projekt oferty | Mediana czasu niższa o co najmniej 30%; co najmniej 75% materiałów przyjętych z drobnymi zmianami; 100% cen pobranych z autoryzowanego źródła; zatwierdzenie człowieka dla każdej oferty |
Podane wartości są przykładem konstrukcji kryteriów. Właściciel procesu ustala progi zgodnie z kosztem błędu, wymaganą jakością i tolerancją ryzyka organizacji.
12. Jak dobrać zakres nadzoru człowieka do ryzyka związanego z AI?
NIST definiuje ryzyko jako połączenie prawdopodobieństwa zdarzenia i skali jego konsekwencji. Ta zasada pozwala przełożyć ogólne obawy związane z AI na mierzalny model: częstotliwość błędów, wartość środków lub zasobów narażonych na stratę, możliwość cofnięcia działania, czas wykrycia błędu i koszt jego naprawy
W skonsolidowanym tekście unijnego AI Act wymagania dla systemów wysokiego ryzyka obejmują ciągłe zarządzanie ryzykiem, odpowiedni poziom dokładności, odporności i cyberbezpieczeństwa oraz skuteczny nadzór człowieka. Środki nadzoru mają być proporcjonalne do ryzyka, poziomu autonomii i kontekstu użycia. Testy powinny korzystać z uprzednio zdefiniowanych metryk i progów właściwych dla zamierzonego zastosowania.
W praktyce biznesowej oznacza to przypisanie konkretnej osoby do zatwierdzania, monitorowania i reagowania. Interfejs powinien pokazywać źródła, wykonane działania i poziom niepewności, a użytkownik musi mieć możliwość zatrzymania procesu. Ryzyko poważnych konsekwencji błędu uzasadnia ograniczenie uprawnień modelu, dodatkowe sprawdzanie wyników i dłuższe testy w trybie obserwacyjnym. Klasyfikację regulacyjną należy ustalić osobno dla zamierzonego zastosowania i roli organizacji.
13. Jak połączyć LLM, SLM i reguły w jednym procesie biznesowym?
Połączenie kilku technologii pozwala dopasować sposób obsługi do poszczególnych etapów procesu. Przykładowo SLM rozpoznaje temat zgłoszenia klienta, a LLM przygotowuje odpowiedź na podstawie historii kontaktu i dokumentów pobranych przez RAG. Gdy sprawa dotyczy zwrotu pieniędzy, system sprawdza warunki i limity zgodnie z ustalonymi regułami, a następnie kieruje operację do realizacji lub zatwierdzenia przez uprawnionego pracownika. Tak zaprojektowana obsługa łączy automatyzację z kontrolą decyzji mających skutki finansowe.
W TTMS pomożemy Ci ocenić, gdzie podobne rozwiązanie przyniesie największą korzyść. Zaczniemy od zadań, które pochłaniają najwięcej czasu: powtarzalnych czynności, wyszukiwania informacji czy poprawiania błędów. Podczas konsultacji przeanalizujemy przebieg pracy, dostępne dane i wykorzystywane systemy. Na tej podstawie zaproponujemy technologię i zakres pilotażu, a wspólnie z Tobą ustalimy oczekiwane efekty oraz sposób pomiaru jakości, czasu i kosztów.
Chcesz wybrać pierwszy proces do usprawnienia? Umów się z nami na konsultację dotyczącą wdrożenia AI.

Źródła
- Eurostat, 20% of EU enterprises use AI technologies, 11 grudnia 2025.
- Fabrizio Dell’Acqua et al., Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality, Organization Science.
- Erik Brynjolfsson, Danielle Li, Lindsey Raymond, Generative AI at Work, NBER Working Paper 31161, 2023.
- Joel Becker, Nate Rush, Beth Barnes, David Rein, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, METR, 10 lipca 2025.
- Microsoft Azure, What Are Small Language Models (SLMs)?.
- Microsoft Azure, Boost processing performance by combining AI models, 8 stycznia 2025.
- OpenAI, Enterprise privacy at OpenAI.
- Google Cloud, The KPIs that actually matter for production AI agents, 26 lutego 2026.
- NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, lipiec 2024.
- Unia Europejska, Rozporządzenie (UE) 2024/1689, tekst skonsolidowany z 27 lipca 2026.
- OWASP GenAI Security Project, LLM06:2025 Excessive Agency, 2025.
FAQ
Czy do pracy na danych firmowych trzeba uruchamiać własny model AI?
Własny model jest jednym z dostępnych wariantów. Firmy mogą korzystać z zatwierdzonego środowiska biznesowego, zarządzanego API, prywatnej chmury, wydzielonej infrastruktury lub modelu działającego lokalnie. Wybór zależy od klasy danych, lokalizacji przetwarzania, retencji, szyfrowania, tożsamości użytkowników, wymogów branżowych i umowy z dostawcą. Przykładowo OpenAI deklaruje brak domyślnego trenowania na danych klientów biznesowych i oferuje dodatkowe mechanizmy kontroli retencji dla kwalifikujących się klientów API. Organizacja powinna udokumentować przepływ danych dla konkretnej konfiguracji, ponieważ nazwa modelu nie opisuje całej architektury bezpieczeństwa.
Czy RAG może zastąpić fine-tuning modelu na danych firmy?
RAG i fine-tuning rozwiązują różne problemy. RAG pobiera aktualne informacje z kontrolowanego źródła w momencie tworzenia odpowiedzi, dzięki czemu dobrze pasuje do baz wiedzy, procedur, dokumentacji i treści często aktualizowanych. Fine-tuning dostosowuje zachowanie modelu do przykładów, stylu, formatu albo wyspecjalizowanego zadania. Dokumentacja AWS porównująca RAG i fine-tuning rekomenduje rozpoczęcie systemu pytań i odpowiedzi na własnych dokumentach od RAG, zwłaszcza gdy ważne są aktualność i odwołania do źródeł. Oba mechanizmy mogą działać razem, jeśli proces wymaga zarówno aktualnej wiedzy, jak i stabilnego zachowania domenowego.
Czy jeden proces może korzystać jednocześnie z LLM i SLM?
Tak. Router może kierować typowe, dobrze rozpoznane sprawy do SLM, a przypadki złożone do większego LLM. Trzecia ścieżka prowadzi do człowieka, gdy system wykryje brak danych, niską pewność albo wysoki poziom ryzyka. Innym wariantem jest podział procesu według funkcji: SLM klasyfikuje dokument, LLM przygotowuje wyjaśnienie, kod oblicza wartości, a workflow zapisuje zatwierdzoną decyzję. Taki układ pozwala kontrolować koszty i czas reakcji przy zachowaniu dostępu do większych możliwości w trudniejszych sprawach.
Ile przykładów potrzeba do pilotażu LLM lub SLM?
Liczba zależy od oczekiwanej precyzji pomiaru i rzadkości błędów. Dla odsetka skutecznych odpowiedzi próba około 385 niezależnych przypadków daje przybliżony margines +/-5 punktów procentowych przy poziomie ufności 95% w wariancie konserwatywnym. Margines +/-3 punkty wymaga około 1 068 przypadków. Losowa próba powinna odzwierciedlać rzeczywisty wolumen, języki, kanały i typy użytkowników. Osobny zestaw powinien obejmować przypadki krytyczne, brzegowe, rzadkie oraz próby manipulacji systemem.
Jak często trzeba ponownie testować aplikację opartą na modelu językowym?
Pełna ewaluacja powinna zostać uruchomiona po zmianie modelu, wersji promptu, narzędzia, uprawnień, źródła danych, reguł biznesowych lub formatu wejścia. Produkcja wymaga również ciągłego monitorowania najważniejszych KPI oraz cyklicznego testu regresji. Częstotliwość zależy od ryzyka i tempa zmian procesu. Aplikacja obsługująca treści marketingowe może mieć inny harmonogram niż system wspierający decyzje finansowe. Praktycznym rozwiązaniem jest automatyczny test przy każdej zmianie technicznej, miesięczny przegląd trendów oraz kwartalna ewaluacja biznesowa, z krótszym cyklem dla zastosowań wysokiego ryzyka.