TTMS Blog
Świat okiem ekspertów IT
Wpisy autorstwa: Marcin Kapuściński
RAG dla chatbota na przykładzie CrewAI – notatki z TTMS Tech Talk
Tech Talk to wewnętrzny cykl spotkań technologicznych dla pracowników TTMS, podczas których dzielimy się wiedzą i doświadczeniami z projektów. Pokazujemy sprawdzone narzędzia, omawiamy napotkane problemy i rozwiązania, które pomogły nam w pracy. Tematy obejmują m.in. sztuczną inteligencję, analitykę danych, Salesforce, AEM i zarządzanie projektami. Po prezentacjach jest czas na pytania, dyskusję i wymianę pomysłów. Podczas spotkania „RAG dla chatbota na przykładzie CrewAI”, które odbyło się 17 września, Jakub Kraśniewski, Senior AI Developer w TTMS, opowiedział o usprawnieniu chatbota korzystającego z dokumentacji klienta. Przedstawił problemy z przygotowaniem i wyszukiwaniem informacji, zastosowane rozwiązanie oraz sposób sprawdzania jakości odpowiedzi. Projekt dotyczył firmy z sektora edukacyjnego, której klienci przygotowują się do egzaminu certyfikacyjnego. Chatbot miał pomagać im w uzyskiwaniu informacji o zapisach, przebiegu egzaminu, ocenianiu i odwołaniach, a tym samym odciążyć dział wsparcia. Korzystał z publicznie dostępnych dokumentów PDF obejmujących kilkaset stron, głównie w języku angielskim. Zespół potrzebował sposobu na trafne wyszukiwanie odpowiedzi w tych materiałach przy wymaganym czasie oczekiwania rzędu 4 do 5 sekund. 1. Jak RAG pomaga chatbotowi korzystać z wiedzy firmy? Na początku prezentacji Jakub wyjaśnił, jak działa RAG (Retrieval-Augmented Generation), czyli generowanie odpowiedzi z wykorzystaniem wyszukanych materiałów źródłowych. System odnajduje informacje związane z pytaniem użytkownika i przekazuje je modelowi językowemu jako kontekst odpowiedzi. W omawianym projekcie były to fragmenty dokumentacji opisującej zasady i procedury egzaminacyjne. Po odczytaniu tekstu z dokumentów system dzieli go na mniejsze fragmenty. Model embeddingowy (model AI przedstawiający cechy znaczeniowe tekstu w postaci liczb) przekształca je w wektory zapisywane w bazie. W ten sam sposób przetwarzane jest pytanie użytkownika. Porównanie tych reprezentacji pozwala wyszukać fragmenty powiązane znaczeniowo z pytaniem. Jakub podkreślał, że zespół odpowiada za jakość materiałów przekazywanych modelowi. Trzeba sprawdzić, czy tekst został poprawnie odczytany, czy podział zachował potrzebny kontekst i czy wyszukiwanie dostarcza informacje przydatne do odpowiedzi. Znaczenie tych etapów pokazały problemy, na które zespół natrafił w rozwiązaniu wykorzystującym CrewAI. 2. Co utrudniało wyszukiwanie informacji w projekcie z CrewAI? Po wyjaśnieniu podstaw RAG Jakub przeszedł do doświadczeń z projektu wykorzystującego CrewAI, zestaw narzędzi do budowania systemów opartych na agentach AI. Omówił trzy problemy napotkane w używanej konfiguracji: zbyt obszerne fragmenty tekstu, brak dodatkowej oceny trafności wyników oraz błędy w odczycie dokumentów PDF. 2.1 Zbyt obszerne fragmenty dokumentów W konfiguracji opisanej przez Jakuba tekst dzielono na fragmenty po 4000 znaków. Dla jednego pytania system pobierał pięć takich fragmentów, więc do modelu trafiało nawet około 20 000 znaków materiału źródłowego. Duży fragment może zawierać informacje dotyczące kilku różnych zagadnień, co utrudnia dopasowanie go do konkretnego pytania. Model generujący odpowiedź musi następnie wybrać potrzebne informacje spośród przekazanych treści. W tym projekcie sposób podziału dokumentów wymagał więc dostosowania do ich struktury i pytań użytkowników. 2.2 Brak dodatkowej oceny trafności wyników Jakub zwrócił uwagę, że w używanej konfiguracji brakowało rerankingu, czyli ponownej oceny i uporządkowania wyników wyszukiwania według ich przydatności do odpowiedzi na pytanie użytkownika. System może najpierw wyszukać większą liczbę fragmentów, a następnie poddać je dodatkowej ocenie, aby wybrać te najbardziej przydatne do przygotowania odpowiedzi. Jakub wskazał tę metodę jako możliwe usprawnienie, którego przydatność warto ocenić, sprawdzając zarówno jakość odpowiedzi, jak i czas oczekiwania na nią. 2.3 Błędna kolejność odczytu tekstu w wielokolumnowych PDF-ach Kolejny problem dotyczył odczytu dokumentów. Narzędzie pobierało tekst z wielokolumnowych PDF-ów wiersz po wierszu, łącząc treści z sąsiadujących kolumn. Zaburzało to kolejność zdań i utrudniało późniejsze wyszukiwanie informacji. Tak przetworzony tekst trafiał do dalszego podziału na fragmenty. Błąd powstawał więc już podczas przygotowania danych i wpływał na kolejne etapy pracy z dokumentacją. Ten przykład pokazał, dlaczego sprawdzanie jakości RAG warto rozpocząć od porównania odczytanego tekstu z dokumentem źródłowym. 3. Jak czas odpowiedzi wpływa na wybór między Classic RAG, Agentic RAG i Graph RAG? W projekcie istotnym wymaganiem była odpowiedź w czasie około 4 do 5 sekund. Jakub omówił trzy podejścia do RAG z perspektywy kosztu przygotowania danych, możliwości sprawdzania działania oraz czasu potrzebnego na obsługę pytania. Podejście Sposób działania omawiany na spotkaniu Co uwzględnić przy wyborze Classic RAG Wyszukiwanie fragmentów w bazie wiedzy, opcjonalny reranking i przekazanie kontekstu do modelu. Jakość podziału dokumentów, trafność wyszukiwania i objętość przekazywanego kontekstu. Agentic RAG Agent dobiera narzędzia i sposób wyszukiwania, a w razie potrzeby wykonuje kolejne zapytania. Możliwość dostosowania wyszukiwania do pytania oraz czas i koszt dodatkowych operacji. Graph RAG Wyszukiwanie wykorzystuje graf wiedzy opisujący obiekty występujące w materiałach oraz relacje między nimi. Nakład na budowę i utrzymanie grafu oraz przydatność relacji dla pytań użytkowników. W podejściu agentowym model może korzystać z kilku narzędzi, na przykład wyszukiwania wektorowego, wyszukiwania po słowach kluczowych lub filtrowania po metadanych opisujących dokument. Kolejne kroki pozwalają rozbudowywać poszukiwanie informacji, a ich liczba i kolejność wpływają na czas odpowiedzi. W przedstawionym podejściu grafowym część pracy wykonywana jest podczas budowania bazy wiedzy. Z tekstu wydobywa się obiekty i łączące je relacje. Taki mechanizm stanowi również podstawę GraphRAG opisanego przez Microsoft. Jakub zwracał uwagę na koszty tego przygotowania i trudność ręcznej analizy rozbudowanego grafu. W omawianym projekcie wymagany czas odpowiedzi przemawiał za rozwijaniem klasycznego RAG. Zespół skupił się na sposobie podziału dokumentów i doboru kontekstu. 4. Jak hierarchiczne dzielenie dokumentów pomaga zachować kontekst? Zastosowane rozwiązanie polegało na uporządkowaniu materiału na trzech powiązanych poziomach: strony, akapitu i zdania. System zachowywał informację o tym, do którego akapitu należy zdanie oraz na której stronie znajduje się akapit. Treść była reprezentowana w bazie wektorowej na różnych poziomach szczegółowości. Dzięki temu wyszukiwanie mogło odnaleźć zarówno konkretne zdanie, jak i większy fragment zawierający potrzebne informacje. Według relacji Jakuba dodatkowy koszt przechowywania i przetwarzania tych reprezentacji był akceptowalny przy skali materiałów w projekcie. Odnalezienie trafnego zdania pozwalało pobrać obejmujący je akapit i przekazać modelowi szerszy kontekst. W zależności od potrzeb można było sięgnąć również po całą stronę. Załóżmy, że użytkownik pyta o termin odwołania od wyniku egzaminu. System odnajduje zdanie określające ten termin, a następnie pobiera cały akapit, który wyjaśnia, od kiedy należy go liczyć i jak złożyć odwołanie. Dzięki temu model może uwzględnić te warunki w odpowiedzi. 5. Jak sprawdzać jakość RAG na własnych danych? W końcowej części prezentacji Jakub podkreślił znaczenie benchmarku, czyli zestawu testów pozwalającego porównywać warianty rozwiązania. Omówił sprawdzanie wyników wyszukiwania względem informacji oznaczonych przez człowieka oraz wykorzystanie modelu językowego do oceny odpowiedzi. W praktyce warto rozdzielić ocenę na dwa poziomy. Pierwszy dotyczy wyszukiwania: czy system dostarczył fragment zawierający potrzebną informację? Drugi obejmuje odpowiedź: czy model poprawnie wykorzystał otrzymany materiał? Taki podział pomaga ustalić, który etap wymaga poprawy. W dodatkowych informacjach przekazanych po spotkaniu Jakub doprecyzował sposób testowania i uzyskane wyniki. Zestaw testowy obejmował pytania z całego zakresu dokumentacji oraz rzeczywiste pytania użytkowników, zebrane anonimowo podczas uruchomienia prototypu na początku roku. Dokładność odpowiedzi wzrosła z około 70% do około 98%, czyli o około 28 punktów procentowych. Wynik dotyczy wewnętrznego testu przeprowadzonego w tym projekcie. Według relacji Jakuba rozwiązanie zachowało również szybki czas odpowiedzi. W chwili przekazania tych informacji chatbot miał za sobą testy wewnętrzne, a firma planowała udostępnić go części klientów. Odciążenie działu wsparcia i ułatwienie dostępu do informacji pozostawały celami wdrożenia. Ocena ich realizacji wymaga danych z użytkowania narzędzia. Osobnym obszarem oceny pozostaje model embeddingowy. Jakub wskazywał, że jego dobór powinien uwzględniać język materiałów i wyniki uzyskiwane na własnym zbiorze danych. Wybór tego modelu wpływa na to, jakie fragmenty system odnajdzie, zanim rozpocznie generowanie odpowiedzi. 6. Co z tych doświadczeń wynika dla firm wdrażających chatbota? Omówiony projekt pokazuje, jak konkretne wymagania porządkują pracę nad RAG. Oczekiwany czas odpowiedzi pomógł zawęzić wybór rozwiązania, analiza dokumentów ujawniła problemy z odczytem i podziałem treści, a wewnętrzny test pozwolił ocenić efekt zmian. Przy planowaniu podobnego wdrożenia warto uporządkować pięć kwestii: Materiały źródłowe: sprawdzić, czy odczyt dokumentów zachowuje sens i kolejność tekstu. Podział treści: dopasować wielkość fragmentów i powiązania między nimi do struktury materiałów. Pytania użytkowników: przygotować zestaw odzwierciedlający zadania, które chatbot ma obsługiwać. Czas odpowiedzi: ustalić oczekiwania i uwzględniać je podczas porównywania wariantów. Ocena jakości: sprawdzać zarówno trafność wyszukanych informacji, jak i sposób wykorzystania ich w odpowiedzi. Porozmawiajmy o AI w Twojej firmie W TTMS pracują eksperci, którzy tak jak Jakub łączą wiedzę technologiczną z doświadczeniem w projektach dla klientów. Podczas Tech Talków dzielą się rozwiązaniami sprawdzonymi w praktyce, a zdobytą wiedzę wykorzystują w kolejnych wdrożeniach. Planujesz chatbota korzystającego z firmowej dokumentacji lub chcesz poprawić jakość odpowiedzi istniejącego narzędzia? Zapraszamy do rozmowy. Przyjrzymy się Twoim materiałom, potrzebom użytkowników i celom biznesowym, aby zaproponować odpowiedni sposób wykorzystania AI. Skontaktuj się z zespołem TTMS! Jakie dokumenty mogą tworzyć bazę wiedzy chatbota z RAG? Chatbot z RAG może korzystać z firmowych polityk, instrukcji obsługi produktów, procedur, odpowiedzi na najczęściej zadawane pytania i innych materiałów zawierających informacje przydatne użytkownikom. W zależności od dostępnych integracji źródłami mogą być pliki PDF, dokumenty Word, treści stron internetowych i artykuły z bazy wiedzy. Zeskanowane dokumenty wymagają optycznego rozpoznawania znaków (OCR), które przekształca obraz tekstu w treść możliwą do przeszukiwania. Tabele, diagramy i złożone układy stron mogą wymagać dodatkowego przetwarzania, aby zachować ich znaczenie. Przed dodaniem dokumentów należy sprawdzić, czy są poprawne, aktualne i zatwierdzone do udostępnienia danej grupie odbiorców. Przejrzysta struktura materiałów pomaga systemowi wyszukiwać informacje i dostarczać kontekst potrzebny do odpowiedzi. Jak aktualizować bazę wiedzy chatbota z RAG? Utrzymanie aktualnej bazy wiedzy chatbota z RAG wymaga procesu wykrywania i przetwarzania zmian w materiałach źródłowych. W zależności od potrzeb firmy aktualizacje mogą odbywać się według harmonogramu lub po dodaniu, zmianie albo usunięciu dokumentu. System aktualizuje wówczas przeszukiwane treści oraz powiązane z nimi reprezentacje, takie jak embeddingi, czyli liczbowe reprezentacje cech znaczeniowych tekstu. Informacje o wersji i datach obowiązywania pomagają odróżnić aktualne wytyczne od starszych materiałów. Dokumenty usunięte lub zastąpione nowszymi wersjami należy również wycofać z aktywnych wyników wyszukiwania, a odpowiedzi zapisane w pamięci podręcznej mogą wymagać odświeżenia. Wyznaczenie osoby odpowiedzialnej za każdy obszar treści pomaga zadbać o jakość informacji wykorzystywanych przez chatbota. Czy chatbot z RAG może podawać źródła swoich odpowiedzi? Tak, chatbot z RAG może dołączać do odpowiedzi linki, tytuły dokumentów, numery stron lub cytowane fragmenty. Wymaga to zachowania informacji o źródłach podczas przetwarzania dokumentów i powiązania wyszukanych fragmentów z odpowiedzią. Przydatne odwołania pozwalają użytkownikowi otworzyć właściwy materiał i samodzielnie sprawdzić kontekst. System powinien również weryfikować, czy każde wskazane źródło potwierdza informację, do której się odnosi. Sam link do źródła nie gwarantuje, że odpowiedź poprawnie odzwierciedla treść dokumentu. Podczas testów należy sprawdzać zarówno jakość odpowiedzi, jak i poprawność odwołań, w tym możliwość otwarcia wskazanych materiałów przez użytkownika. Jak chatbot z RAG może uwzględniać uprawnienia dostępu do dokumentów firmowych? Chatbot z RAG może wykorzystywać tożsamość i uprawnienia zalogowanego użytkownika, aby określić, które dokumenty wolno mu przeszukiwać. Weryfikacja uprawnień powinna nastąpić, zanim treści objęte ograniczeniami dostępu trafią do modelu językowego. Te same zasady muszą obejmować podgląd dokumentów, odwołania do źródeł i odpowiedzi zapisane w pamięci podręcznej, jeśli zawierają chronione informacje. Zmiany uprawnień w systemie źródłowym powinny być również uwzględniane podczas wyszukiwania informacji przez chatbota. Zespół powinien przetestować rozwiązanie na kontach o różnych rolach, w tym z ograniczonym dostępem. Takie testy pomagają potwierdzić, że każda osoba otrzymuje odpowiedzi oparte na informacjach, do których ma uprawnienia. Co powinien zrobić chatbot z RAG, gdy nie znajdzie odpowiedzi? Gdy dostępne dokumenty zawierają zbyt mało informacji, chatbot z RAG powinien jasno poinformować, że na podstawie swoich źródeł nie może udzielić wiarygodnej odpowiedzi. Jeśli pytanie jest niejednoznaczne, może poprosić o doprecyzowanie lub wskazać powiązany dokument, który może pomóc użytkownikowi. W sprawach wymagających dalszej pomocy może skierować go do odpowiedniego zespołu lub kanału wsparcia. System potrzebuje jasno określonych zasad postępowania z informacjami niepełnymi, sprzecznymi lub brakującymi. Testy powinny obejmować pytania, na które baza wiedzy nie zawiera odpowiedzi, aby zespół mógł ocenić zachowanie chatbota w takich sytuacjach. Analiza pytań pozostawionych bez odpowiedzi może również ujawnić luki w dokumentacji firmy i pomóc ustalić priorytety kolejnych aktualizacji.
CzytajChatGPT dla usług finansowych: co daje połączenie GPT z profesjonalnymi źródłami danych?
10 września 2026 r. OpenAI ogłosiło ChatGPT for Financial Services, rozwiązanie łączące GPT-6 Astra z profesjonalnymi źródłami danych finansowych i narzędziami do przygotowywania analiz. Produkt powstał we współpracy z Morgan Stanley i Evercore. Jest skierowany do instytucji finansowych, a na początek ma wspierać pracę w bankowości inwestycyjnej i analizie akcji. Zespoły analityczne mogą dzięki niemu wyszukiwać dane, wykonywać obliczenia i przygotowywać materiały dla klientów w jednym miejscu. To szansa na skrócenie czasu poświęcanego na zbieranie informacji i przenoszenie ich między narzędziami. Z tego artykułu dowiesz się: jakie dane i funkcje oferuje ChatGPT for Financial Services, jak może wyglądać przygotowanie analizy spółki z pomocą GPT, dlaczego trzeba sprawdzać sposób obliczania wskaźników i źródła danych, na których etapach potrzebna jest kontrola analityka, jak ocenić, czy wdrożenie opłaca się firmie. Jak ChatGPT for Financial Services wspiera pracę analityka? W materiałach OpenAI oraz dostawców danych opisano kilka konkretnych zastosowań: Porównywanie spółek. Daloopa (dostawca danych finansowych o spółkach) udostępnia wybrane dane i wskaźniki, które mogą posłużyć do zestawienia wyników przedsiębiorstw. Odwołania do źródeł pomagają sprawdzić pochodzenie liczb. Wyszukiwanie firm spełniających określone kryteria. Daloopa opisuje też wyszukiwanie spółek według rodzaju działalności lub obszaru geograficznego. Takie zestawienie może być punktem wyjścia do dalszej analizy rynku. Przygotowywanie materiałów dla klientów. OpenAI opisuje tworzenie modeli wyceny, not analitycznych i prezentacji z wykorzystaniem firmowych szablonów do programów Excel, Word i PowerPoint. W ChatGPT for Financial Services można korzystać z wybranych danych udostępnianych przez Daloopa, PitchBook, LSEG News i Crunchbase. OpenAI pracuje również nad integracjami, dzięki którym instytucje będą mogły korzystać z danych dostępnych w ramach już wykupionych abonamentów. Prace obejmują m.in. S&P Capital IQ, LSEG, MSCI, Dow Jones Factiva i Moody’s. Od danych do analizy spółki: pięć etapów pracy Prześledźmy przygotowanie porównania dwóch przedsiębiorstw przemysłowych przed spotkaniem z klientem. Analityk ma ocenić rentowność, wyjaśnić istotne różnice i przygotować krótką notę z tabelą wyników. Na fikcyjnych danych pokażemy, co warto sprawdzić podczas pilotażu: od doboru informacji po zatwierdzenie gotowego materiału. 1. Ustalenie pytania i zakresu porównania Najpierw ustalamy, jaki okres chcemy porównać: ostatni pełny rok, półrocze czy ostatnie dwanaście miesięcy. Sprawdzamy też, czy liczby dotyczą całej grupy kapitałowej, czy pojedynczej spółki, w jakiej walucie je podano i jak obliczono poszczególne wskaźniki. W naszym przykładzie korzystamy ze skonsolidowanych danych obu grup kapitałowych za ten sam rok kalendarzowy. Kwoty podajemy w milionach złotych. Przed porównaniem wyników trzeba sprawdzić daty rozpoczęcia i zakończenia okresów raportowania. Jedna firma może kończyć rok obrotowy w grudniu, a druga w marcu. Na takie różnice zwraca uwagę również dokumentacja bazy EDGAR prowadzonej przez amerykańską SEC. Analityk musi wtedy zdecydować, jak uwzględnić przesunięcie i czy potrzebuje dodatkowych danych. Przyjęte zasady warto zapisać w instrukcji dla AI i dołączyć do gotowej analizy. Dzięki temu model otrzyma jasne wytyczne, a osoba sprawdzająca wynik będzie wiedziała, jakie dane porównano i dlaczego. 2. Zebranie danych i wskazanie ich źródeł Przy każdej ważnej liczbie warto zapisać, jakiej spółki i okresu dotyczy, w jakich jednostkach ją podano oraz jak została obliczona. Do tego potrzebny jest odnośnik do konkretnej tabeli lub objaśnienia w raporcie. Zachowanie dokumentu źródłowego i daty jego pobrania ułatwi późniejsze sprawdzenie lub aktualizację analizy. Według opisu OpenAI ChatGPT for Financial Services pozwala dotrzeć do konkretnych tabel i fragmentów dokumentów, wyróżniając informacje wykorzystane w analizie. W naszym przykładzie porównujemy EBITDA, czyli wynik przed odsetkami, podatkiem dochodowym i amortyzacją. Osoba sprawdzająca analizę powinna móc przejść od podanej wartości do raportu spółki i sprawdzić sposób jej obliczenia. Dzięki temu sprawdzi również, czy wynik dotyczy właściwego okresu i części działalności. 3. Uzgodnienie definicji przed porównaniem marż Spółki mogą publikować skorygowaną EBITDA, przy której obliczaniu wyłączają wybrane koszty. Takie korekty zwiększają wartość wskaźnika. Dlatego przed porównaniem ich rentowności trzeba sprawdzić, jakie korekty zastosowano. Na różnice w sposobie obliczania wskaźników przez poszczególne firmy zwraca uwagę również amerykańska SEC. Przyjrzyjmy się dwóm fikcyjnym spółkom. Przyjmujemy, że obie spółki obliczają EBITDA przed korektami według tych samych zasad. Spółka A dodaje następnie do tego wyniku 20 mln zł kosztów, które wyłącza przy obliczaniu skorygowanej EBITDA. W rezultacie wskaźnik rośnie ze 120 do 140 mln zł. W spółce B takie koszty nie występują, więc wynik pozostaje bez zmian. Przykład ilustracyjny. Dane skonsolidowane za ten sam rok kalendarzowy. Kwoty podano w mln zł. Pozycja Spółka A Spółka B Przychody 1 000 800 EBITDA przed korektą 120 104 Koszty wyłączone przy obliczaniu skorygowanej EBITDA 20 0 Skorygowana EBITDA 140 104 Marża EBITDA przed korektą 12% 13% Marża skorygowanej EBITDA 14% 13% Po korekcie marża spółki A wynosi 14% i przewyższa marżę spółki B, która wynosi 13%. Przed korektą to spółka B ma wyższą marżę: 13% wobec 12%. W tym przykładzie sposób uwzględnienia kosztów decyduje o tym, która spółka ma wyższą marżę EBITDA. Analityk powinien więc sprawdzić, jakie koszty składają się na korektę w wysokości 20 mln zł i czy występowały również w poprzednich latach. Na tej podstawie ocenia, czy wyłączenie tych kosztów jest uzasadnione w przygotowywanej analizie. Może też pokazać oba warianty i wyjaśnić klientowi, skąd bierze się różnica. AI może pomóc zebrać dane i przeliczyć marże, a ekspert ocenia zasadność korekty i jej wpływ na wnioski. 4. Sprawdzenie obliczeń w arkuszu W naszym przykładzie wystarczy podzielić EBITDA przez przychody: 120 ÷ 1 000 daje marżę 12%, a 140 ÷ 1 000 daje 14%. Bardziej złożone analizy mogą wymagać przeliczenia walut, dopasowania okresów raportowania czy przygotowania kilku wariantów prognozy. Osoba sprawdzająca wynik powinna móc prześledzić każdy z tych kroków. Dlatego warto poprosić AI o arkusz, w którym dane źródłowe, założenia i formuły są wyraźnie rozdzielone. Analityk może wtedy sprawdzić rachunki i zobaczyć, jak zmiana jednej wartości wpływa na wynik. Aby sprawdzić działanie arkusza, można testowo zmniejszyć korektę z 20 do 10 mln zł. Skorygowana EBITDA spółki A powinna wtedy wynieść 130 mln zł, a odpowiadająca jej marża 13%. Po takiej zmianie trzeba również sprawdzić tabelę porównawczą i opis wyników. Obie spółki miałyby już taką samą marżę, więc wniosek o wyższej marży spółki A wymagałby aktualizacji. To prosty sposób, by ocenić, czy obliczenia i towarzyszący im tekst pozostają ze sobą zgodne. 5. Przygotowanie materiału dla klienta i sprawdzenie wniosków Gotową analizę można opracować w formacie używanym przez firmę. Według opisu OpenAI administrator może udostępnić zespołowi szablony do programów Excel, Word i PowerPoint, z których narzędzie korzysta przy tworzeniu dokumentów i prezentacji. W naszym przykładzie klient powinien otrzymać tabelę wyników oraz krótkie wyjaśnienie, jak korekta kosztów wpływa na porównanie marż. Ekspert sprawdzający materiał ocenia, czy wnioski zgadzają się z obliczeniami i odpowiadają na pytanie klienta. Jeśli coś wymaga doprecyzowania, może poprosić o dodatkowe wyjaśnienie lub kolejny wariant analizy. Pomiar czasu pracy powinien obejmować również sprawdzenie materiału i wprowadzenie poprawek przed jego zatwierdzeniem. Jak chronić dane i zachować historię pracy nad analizą? Przygotowując analizę dla klienta, zespół może korzystać z publicznych raportów, płatnych baz i poufnych dokumentów. Trzeba ustalić, kto ma dostęp do tych informacji, gdzie będą przechowywane i komu można przekazać gotowy materiał. Według dokumentacji bezpieczeństwa ChatGPT Work dane biznesowe są szyfrowane i domyślnie nie służą do trenowania modeli. Czas ich przechowywania, miejsce przetwarzania oraz zakres zapisywanej historii działań zależą od ustawień i podłączonych usług. Przed wdrożeniem trzeba sprawdzić, które działania użytkowników i narzędzi są zapisywane w rejestrach oraz które z tych zapisów można wyeksportować. Podczas pilotażu warto zachować dokumenty źródłowe, kolejne wersje arkusza oraz gotowy materiał z informacją, kto i kiedy go zatwierdził. Następnie trzeba sprawdzić, czy zgromadzona dokumentacja pozwala odtworzyć obliczenia i prześledzić zatwierdzenie analizy. Osobno trzeba zweryfikować, czy rejestry systemowe pozwalają prześledzić działania użytkowników i narzędzi w zakresie wymaganym przez firmę. Jak ocenić, czy wdrożenie się opłaca? Na początek warto wybrać zadanie, które zespół wykonuje regularnie, np. aktualizację porównania spółek po publikacji wyników kwartalnych. Przed testem trzeba zmierzyć czas wykonania takiej analizy dotychczasową metodą i ustalić wymagania dotyczące jej jakości. Te wyniki posłużą do porównania pracy z wykorzystaniem AI. Do czasu przygotowania analizy trzeba doliczyć czas potrzebny na jej sprawdzenie i wprowadzenie poprawek. OpenAI zwraca na to uwagę w materiale o ocenie korzyści z AI, zalecając również uwzględnienie kosztów wdrożenia i późniejszego korzystania z narzędzia. W praktyce warto porównać: Miernik Czego się dowiemy? Czas od rozpoczęcia zadania do zatwierdzenia analizy Czy klient szybciej otrzymuje gotowy materiał? Uwzględniamy też oczekiwanie między etapami. Łączny czas pracy analityka i osoby sprawdzającej Czy zespół poświęca mniej godzin na przygotowanie, kontrolę i poprawki? Liczba błędów wpływających na wynik lub wnioski Czy jakość analizy spełnia te same wymagania co przy dotychczasowym sposobie pracy? Poprawność i kompletność odwołań do źródeł Czy można sprawdzić pochodzenie najważniejszych liczb i informacji? Czas aktualizacji analizy Jak sprawnie można uwzględnić nowe dane i poprawić zależne od nich obliczenia oraz wnioski? Koszt jednej zatwierdzonej analizy Ile kosztuje gotowy materiał po uwzględnieniu pracy zespołu, narzędzia, danych oraz przypadającej na analizę części kosztów wdrożenia i utrzymania? Test powinien objąć kilka zadań o różnym poziomie trudności. Zasady oceny ustalamy przed jego rozpoczęciem. Osoba wykonująca tę samą analizę po raz drugi zna już dane i część odpowiedzi, co może skrócić czas pracy. Dlatego warto wykorzystać porównywalne zadania i zmieniać kolejność pracy z AI oraz dotychczasową metodą. Jeśli AI pozwoli zaoszczędzić czas, warto sprawdzić, jak zespół go wykorzystał. Być może przygotował więcej analiz, szybciej odpowiedział klientom lub ograniczył nadgodziny. W ocenie wdrożenia warto osobno pokazać, jak wykorzystano zaoszczędzony czas oraz czy i o ile zmniejszyły się wydatki firmy. Kiedy warto rozpocząć pilotaż? Pilotaż warto rozważyć, jeśli zespół regularnie zbiera dane z wielu źródeł i aktualizuje podobne analizy. Do testu można wybrać zadanie, które zajmuje analitykom dużo czasu, np. porównywanie danych z raportów spółek. Trzeba też wskazać osobę odpowiedzialną za pilotaż oraz ekspertów, którzy sprawdzą wyniki. Jeśli zespół sporadycznie analizuje kilka raportów rocznych, warto sprawdzić, czy wystarczą narzędzia już dopuszczone do użytku w firmie. Tam, gdzie pobieranie danych i obliczenia są zautomatyzowane, trzeba wskazać konkretne zadanie, które nowe narzędzie mogłoby usprawnić. OpenAI udostępnia produkt instytucjom finansowym spełniającym warunki dostępu i kieruje zainteresowane firmy do działu sprzedaży. Cenę, szczegółowe warunki oraz możliwość korzystania z usługi przez daną instytucję w Polsce trzeba potwierdzić u dostawcy. Informacje o dostępności. Decyzję o wdrożeniu warto oprzeć na wynikach pilotażu: jakości analiz, czasie ich przygotowania i sprawdzenia oraz całkowitym koszcie pracy. Test pokaże też, czy narzędzie zapewnia dostęp do danych potrzebnych zespołowi. Chcesz sprawdzić, gdzie AI może usprawnić pracę analityków w Twojej organizacji? Porozmawiaj z zespołem TTMS o wyborze zadania do pilotażu, połączeniu potrzebnych źródeł danych i sposobie oceny wyników. Czym ChatGPT for Financial Services różni się od analizowania raportów w ChatGPT? ChatGPT for Financial Services zapewnia dostęp do wybranych profesjonalnych danych finansowych bezpośrednio w narzędziu. Umożliwia też odwoływanie się do konkretnych tabel i fragmentów dokumentów oraz przygotowywanie materiałów według firmowych szablonów. Przy ocenie przydatności dla zespołu warto sprawdzić, czy dostępne źródła obejmują potrzebne spółki, okresy i wskaźniki. Czy ChatGPT for Financial Services wymaga osobnych abonamentów na dane finansowe? Możliwość przygotowania takiej analizy zależy od dostępności danych konkretnych spółek. Warto sprawdzić, czy narzędzie udostępnia ich sprawozdania, potrzebne wskaźniki i dane historyczne. Sam komunikat premierowy nie potwierdza pełnego pokrycia GPW. Przydatność rozwiązania najlepiej ocenić na kilku spółkach, które zespół regularnie analizuje. Co zrobić, gdy dane z ChatGPT różnią się od wartości w raporcie spółki? Najpierw trzeba porównać źródła, okresy raportowania, jednostki i definicje wskaźników. Różnica może wynikać np. z wykorzystania danych jednostkowych zamiast skonsolidowanych albo z uwzględnienia korekt EBITDA. Warto również sprawdzić, czy spółka opublikowała zaktualizowany raport. Analityk powinien wyjaśnić rozbieżność i zapisać, którą wartość przyjął oraz z jakiego powodu. Jak uzyskać dostęp do ChatGPT for Financial Services i sprawdzić jego cenę? OpenAI kieruje zainteresowane instytucje finansowe do działu sprzedaży lub opiekuna klienta. W rozmowie należy potwierdzić warunki dostępu, cenę, zakres danych oraz dostępność usługi dla danej instytucji w Polsce. Komunikat premierowy nie zawiera publicznego cennika.
CzytajChatGPT, zintegrowany LLM, SLM czy automatyzacja? Jak dobrać AI do procesu biznesowego
W 2025 roku sztucznej inteligencji używało 20% przedsiębiorstw w Unii Europejskiej, wobec 13,5% rok wcześniej. W Polsce odsetek ten wynosił 8,4%. Najczęstszym zastosowaniem była analiza języka pisanego, z której korzystało 11,8% firm objętych badaniem. Autorzy badania opublikowanego w 2026 roku w Organization Science opisali to zjawisko jako „jagged technological frontier”, czyli nierównomierną granicę możliwości AI: zadania o podobnym poziomie trudności dla człowieka mogą sprawiać modelowi zupełnie różne trudności. Kolejny etap wymaga odpowiedzi na bardziej precyzyjne pytanie: jaka forma AI pasuje do konkretnego zadania? W eksperymencie przeprowadzonym wśród 758 konsultantów osoby korzystające z GPT-4 wykonały 12,2% więcej zadań i ukończyły je średnio o 25,1% szybciej, gdy zadania mieściły się w zakresie możliwości modelu. Przy złożonym zadaniu wykraczającym poza ten zakres prawdopodobieństwo poprawnego rozwiązania spadło o 19 punktów procentowych. Autorzy badania opublikowanego w 2026 roku w Organization Science nazwali tę nieregularną granicę możliwości AI „jagged technological frontier”. Efektywność wynika więc z dopasowania technologii do zadania, danych, ryzyka i sposobu kontroli wyniku. Dla jednego procesu właściwym rozwiązaniem będzie firmowy asystent LLM. Drugi będzie wymagał aplikacji połączonej z CRM, bazą wiedzy i systemem uprawnień. W trzecim sprawdzi się niewielki model działający lokalnie. Operacje o jednoznacznych regułach można powierzyć kodowi, silnikom reguł lub robotyzacji procesów biznesowych (RPA). Klasyczne uczenie maszynowe sprawdza się między innymi w prognozowaniu i klasyfikacji danych. 1. LLM i SLM w firmie: wybór modelu, integracji i miejsca przetwarzania danych Określenia „LLM”, „wdrożony LLM” i „zamknięty SLM” łączą kilka warstw technologii. W praktyce biznesowej warto rozdzielić cztery decyzje: Sposób pracy: czy pracownik rozmawia z gotowym asystentem, czy proces uruchamia się automatycznie? Zakres integracji: czy rozwiązanie pracuje na materiałach przekazanych przez użytkownika, czy pobiera dane i wykonuje działania w systemach firmy? Klasa modelu: czy zadanie wymaga szerokich możliwości dużego modelu językowego, czy wystarczy wyspecjalizowany SLM? Miejsce przetwarzania: czy model działa jako usługa chmurowa, w wydzielonym środowisku, w prywatnej chmurze, lokalnie albo bezpośrednio na urządzeniu? Skrót SLM (Small Language Model) oznacza mały model językowy, zwykle wymagający mniej zasobów obliczeniowych. Określenie „system zamknięty” wymaga doprecyzowania: może odnosić się do ograniczonego dostępu, odizolowanego środowiska lub przetwarzania danych we własnej infrastrukturze. Duży LLM może działać w środowisku prywatnym, a SLM może być udostępniany przez publiczne API. Sama wielkość modelu nie określa warunków bezpieczeństwa danych. 2. Sześć sposobów wykorzystania AI w procesach biznesowych Wariant Jak działa Najlepsze dopasowanie Główny miernik Firmowy asystent LLM Pracownik zleca zadanie i sprawdza wynik w zatwierdzonym środowisku, np. ChatGPT Business lub Enterprise Analiza, redagowanie, podsumowanie, przygotowanie wariantów, praca ad hoc Oszczędność czasu na zadanie po uwzględnieniu weryfikacji i poprawek Zintegrowana aplikacja LLM lub RAG Model korzysta z firmowych źródeł, reguł, uprawnień i integracji Powtarzalne procesy oparte na dokumentach, wiedzy i danych z systemów Koszt poprawnie zakończonej sprawy Agent AI Rozwiązanie planuje kolejne kroki, wybiera narzędzia i realizuje cel w określonym zakresie Wieloetapowe procesy z wyjątkami i dynamiczną ścieżką Odsetek poprawnie wykonanych zadań SLM Mniejszy model obsługuje wąski zakres zadań w chmurze, na serwerze firmy, na edge albo na urządzeniu Duża liczba zadań, stały zakres tematyczny, krótki czas odpowiedzi, praca offline Jakość w porównaniu z LLM przy określonym koszcie i limicie czasu odpowiedzi p95 Prywatne lub lokalne wdrożenie LLM albo SLM działa w kontrolowanym środowisku, prywatnej chmurze, sieci firmy lub na urządzeniu Wymogi lokalizacji danych, ciągłości działania, łączności, infrastruktury lub polityki bezpieczeństwa Zgodność z wymaganiami, jakość, dostępność i całkowity koszt posiadania i użytkowania rozwiązania (TCO) Reguły, RPA lub klasyczne ML Przebieg procesu jest zapisany w kodzie, warunkach, modelu predykcyjnym lub maszynie stanów Obliczenia, transakcje, stałe ścieżki i jednoznaczne decyzje Dokładność, powtarzalność i kompletność śladu audytowego W dojrzałym wdrożeniu warianty te często współpracują. Model językowy interpretuje wiadomość, reguły sprawdzają warunki, aplikacja pobiera dane, człowiek zatwierdza działanie, a system transakcyjny zapisuje wynik. 3. Do jakich zadań wykorzystać ChatGPT lub innego asystenta LLM? Gotowy asystent LLM dobrze wspiera zadania, w których pracownik odpowiada za sprawdzenie i wykorzystanie wyniku. Użytkownik inicjuje pracę, przekazuje kontekst, ocenia odpowiedź i decyduje o jej wykorzystaniu. Wynik ma formę projektu, rekomendacji, analizy lub materiału roboczego. Do tej grupy należą między innymi: przygotowanie pierwszej wersji raportu, wiadomości, prezentacji lub artykułu, streszczenie dokumentów i korespondencji, porównanie kilku materiałów dostarczonych przez użytkownika, tworzenie pytań, scenariuszy i wariantów rozwiązania, tłumaczenie treści przeznaczonych do dalszej kontroli, eksploracyjna analiza danych i wyjaśnianie wyników, porządkowanie notatek ze spotkania, przygotowanie projektu procedury lub planu działania. Taki sposób pracy sprawdza się w procesach, gdy każda odpowiedź przechodzi kontrolę człowieka, rezultat można łatwo poprawić lub wycofać, a zadanie nie wymaga automatycznego zapisu w systemie krytycznym. Duża zmienność materiału i potrzeba pracy językowej dodatkowo zwiększają użyteczność LLM. Bezpieczeństwo zależy od zatwierdzonego produktu i konfiguracji. OpenAI deklaruje, że dane z ChatGPT Business, ChatGPT Enterprise i API nie są domyślnie wykorzystywane do trenowania modeli. Dokumentacja kontroli danych API opisuje również oddzielne zasady retencji, w tym standardowe rejestry służące monitorowaniu nadużyć oraz opcję Zero Data Retention dla klientów spełniających określone warunki. Przed rozpoczęciem pracy organizacja powinna sprawdzić klasyfikację danych, umowę, region przetwarzania, retencję, uprawnienia administratorów i zasady korzystania z połączonych aplikacji. Więcej przykładów takiej pracy zawiera zestawienie 15 integracji ChatGPT z aplikacjami biznesowymi. 3.1 Jak mierzyć oszczędność czasu i jakość pracy z LLM? Badanie pracowników wyłącznie za pomocą ankiety może zawyżać efekt. W eksperymencie METR doświadczeni programiści wykonywali badane zadania z narzędziami AI o 19% dłużej, a po eksperymencie nadal oceniali, że AI przyspieszyła ich pracę o 20%. Badanie obejmowało 16 osób i 246 rzeczywistych zadań w znanych im repozytoriach, więc jego wynik dotyczy tego konkretnego środowiska. Metodologiczny wniosek ma szersze zastosowanie: przed wdrożeniem trzeba zmierzyć rzeczywisty czas i jakość. Dla asystenta LLM warto monitorować medianę czasu wykonania zadania, udział wyników zaakceptowanych bez zmian, średni czas poprawek, jakość ocenianą według jednolitych kryteriów, częstotliwość użycia oraz liczbę przypadków, w których użytkownik wrócił do poprzedniej metody pracy. 4. Kiedy zintegrować LLM z systemami firmy, a kiedy wdrożyć agenta AI? Integracja staje się uzasadniona, gdy wartość procesu zależy od aktualnych danych firmy, powtarzalnego przebiegu i współpracy kilku systemów. Model otrzymuje wtedy kontrolowany dostęp do dokumentów, bazy wiedzy, CRM, ERP, systemu zgłoszeń albo poczty. Aplikacja weryfikuje tożsamość użytkownika, kontroluje zakres udostępnianych danych, ustala format odpowiedzi, sprawdza wyniki, rejestruje działania i kieruje wybrane operacje do zatwierdzenia. Typowa zintegrowana aplikacja AI obejmuje pięć warstw: Wejście: wiadomość, dokument, formularz, zdarzenie systemowe lub rekord. Kontekst: dane pobrane zgodnie z uprawnieniami, często z wykorzystaniem RAG. Model: LLM albo SLM dobrany do konkretnego etapu. Walidacja: reguły, kontrola kompletności, sprawdzenie źródeł, klasyfikacja ryzyka. Wynik: odpowiedź dla człowieka, projekt rekordu albo zatwierdzone działanie w systemie. Takiej architektury wymagają między innymi wyszukiwanie odpowiedzi w wewnętrznej bazie wiedzy, analiza umów według firmowej listy ryzyk, przygotowanie oferty na podstawie CRM i cennika, klasyfikowanie zgłoszeń, wdrażanie nowych pracowników, weryfikacja dokumentów zakupowych oraz tworzenie odpowiedzi na podstawie historii klienta. Mechanizm RAG pozwala pobierać aktualne fragmenty zatwierdzonych źródeł i dołączać je do kontekstu odpowiedzi. Agent AI jest kolejnym poziomem integracji. Otrzymuje cel, dobiera narzędzia i planuje sekwencję działań. Według aktualnych wytycznych Google Cloud dotyczących architektury agentowej agenci pasują do otwartych, wieloetapowych problemów wymagających użycia danych zewnętrznych i pewnego zakresu autonomii. Do przygotowania pojedynczego streszczenia lub tłumaczenia zwykle wystarcza aplikacja o z góry ustalonej sekwencji działań. Rolę zaawansowanego modelu jako warstwy wnioskowania połączonej z narzędziami, danymi i uprawnieniami szerzej opisujemy w artykule GPT-5.5 dla biznesu: nowa era agentów AI. Zakres samodzielnych działań agenta można rozszerzać, gdy wyniki testów potwierdzają wymaganą skuteczność i bezpieczeństwo. Uprawnienia agenta warto ograniczyć do funkcji potrzebnych w danym procesie, rozdzielić odczyt od zapisu i wprowadzić zatwierdzenie działań o istotnych skutkach dla firmy lub klienta. OWASP określa nadmierną funkcjonalność, zbyt szerokie uprawnienia i nadmierną autonomię jako trzy główne źródła ryzyka Excessive Agency. Zasada najmniejszych uprawnień ogranicza skutki błędnej interpretacji, wygenerowania nieprawdziwej informacji lub ataku polegającego na podsunięciu modelowi złośliwych instrukcji (prompt injection). 5. Do jakich procesów biznesowych sprawdzi się mały model językowy SLM? Small Language Model wykorzystuje mniej parametrów i zasobów obliczeniowych niż duży model językowy. Według Microsoft Azure sprzyja to krótszemu czasowi odpowiedzi, niższemu zapotrzebowaniu na infrastrukturę oraz przetwarzaniu danych blisko miejsca ich powstawania (edge computing), np. na urządzeniach przemysłowych. Wyspecjalizowany SLM może sprawdzić się w zadaniach o stałej tematyce, przewidywalnych danych wejściowych i jasno określonym wyniku. Warto przetestować SLM, gdy proces spełnia kilka z poniższych warunków: stały zestaw kategorii, intencji, pól albo typów odpowiedzi, wysoki i przewidywalny wolumen wywołań, krótki wymagany czas reakcji mierzony jako p95, czyli wartość, której nie przekracza 95% czasów odpowiedzi, ograniczone zasoby sprzętowe, potrzeba pracy offline lub bezpośrednio na urządzeniu, dostęp do danych z danego obszaru działalności oraz zestawu wzorcowych odpowiedzi, możliwość przekazywania trudnych przypadków do większego modelu lub człowieka. Przykładem może być klasyfikacja zgłoszeń według 30 stałych kategorii, rozpoznawanie intencji rozmówcy, odczytywanie wartości pól z jednego typu dokumentu, generowanie krótkich odpowiedzi w ściśle określonym zakresie tematycznym albo lokalna analiza komunikatów na urządzeniu przemysłowym. O wyborze decyduje wynik testu na danych firmy. SLM powinien osiągnąć wymagany poziom jakości, czasu odpowiedzi i kosztu poprawnie obsłużonej sprawy. Firma może przykładowo wymagać, aby mniejszy model utrzymywał co najmniej 98% jakości referencyjnego LLM, obniżał koszt poprawnego wyniku o co najmniej 20% i mieścił się w limicie p95. Są to przykładowe progi decyzyjne, które właściciel procesu ustala przed pilotażem. 5.1 Kiedy wdrożyć LLM lub SLM lokalnie albo w prywatnej chmurze? Prywatne lub lokalne wdrożenie może wynikać z wymagań dotyczących suwerenności danych, polityki bezpieczeństwa, ciągłości pracy, opóźnień sieciowych albo środowiska bez dostępu do internetu. Takie wdrożenie może wykorzystywać SLM lub większy model. Równocześnie firmowa aplikacja może korzystać z zarządzanego API z szyfrowaniem, kontrolą retencji, odpowiednim regionem i umową dotyczącą danych. Najbardziej efektywna bywa architektura kaskadowa. Microsoft opisuje model hybrydowy, w którym SLM obsługuje typowe zapytania i przekazuje bardziej złożone przypadki do LLM. W środowisku biznesowym do tej kaskady warto dodać trzecią ścieżkę: przekazanie sprawy pracownikowi, gdy wynik budzi wątpliwości, ryzyko jest wysokie lub brakuje wymaganych danych. 6. Które procesy zautomatyzować za pomocą reguł, RPA lub uczenia maszynowego? Procesy o stałych regułach wymagają jasno określonej kolejności działań i warunków ich wykonania. Dokumentacja AWS dotycząca orkiestracji rozdziela przepływy regułowe, w których kolejne stany i przejścia są jawnie zapisane, oraz orkiestrację agentową, w której model interpretuje cel i dynamicznie wybiera narzędzia. Obie warstwy mogą działać w jednej aplikacji. Proces Rekomendowany mechanizm Rola modelu językowego Naliczenie podatku, wynagrodzenia lub rabatu Kod i silnik reguł Wyjaśnienie wyniku lub interpretacja zapytania użytkownika Wykonanie płatności, zwrotu lub zmiany limitu Proces transakcyjny z kontrolą uprawnień Rozpoznanie intencji i przygotowanie danych do zatwierdzenia Nadanie lub odebranie uprawnień IAM, reguły ról i zatwierdzenia Obsługa zgłoszenia w języku naturalnym Sprawdzenie kompletności wymaganych pól Walidator schematu Ekstrakcja pól z nieustrukturyzowanego dokumentu Prognoza rezygnacji klienta lub popytu Klasyczne uczenie maszynowe Opis czynników i przygotowanie komunikacji Interpretacja dowolnie sformułowanej wiadomości LLM lub SLM Klasyfikacja intencji i przekazanie danych do kontrolowanego workflow W procesie finansowym LLM może odczytać wiadomość, rozpoznać żądanie i przygotować propozycję. Reguły sprawdzają saldo, limity, status klienta i wymagane zgody. System transakcyjny wykonuje operację po spełnieniu warunków. Każda warstwa realizuje zadanie, dla którego można określić jasne kryteria poprawności. 7. Jak dobrać AI do procesu? Cztery kryteria oceny Wstępną kwalifikację można przeprowadzić w czasie krótkiego warsztatu. Osoba odpowiedzialna za proces ocenia go w czterech obszarach, przyznając od 0 do 3 punktów w każdym z nich. Poszczególne oceny pomagają określić wymagania wobec modelu, integracji, zabezpieczeń i infrastruktury. Oś 0 1 2 3 Złożoność interpretacji treści Stałe pola i reguły Stały zestaw kategorii Interpretacja kontekstu Łączenie informacji i wnioskowanie na podstawie wielu źródeł Integracja i autonomia Brak dostępu do systemów Odczyt jednego źródła Odczyt wielu źródeł lub przygotowanie danych do zapisania w systemie Transakcje i dynamiczny wybór narzędzi Skutek błędu Łatwo odwracalny Ograniczony koszt operacyjny Istotny skutek finansowy, prawny lub wizerunkowy Skutek krytyczny, nieodwracalny lub dotyczący praw i bezpieczeństwa Wymagania dotyczące infrastruktury i danych Zarządzana chmura spełnia wymagania Wymagany region lub określona retencja Prywatna sieć albo ścisły limit opóźnienia Praca offline, w środowisku odizolowanym od sieci, na edge lub bezpośrednio na urządzeniu Wyniki można czytać w następujący sposób: Złożoność semantyczna 0-1 i stabilne reguły: kod, workflow, RPA albo klasyczne ML. Złożoność 2-3, integracja 0-1 i skutek błędu 0-1: firmowy asystent LLM z kontrolą użytkownika. Złożoność 2-3 oraz integracja 2-3: zintegrowana aplikacja LLM, RAG lub agent. Złożoność 1-2, wąska domena i presja infrastrukturalna 2-3: SLM jako rozwiązanie do uwzględnienia w testach porównawczych. Skutek błędu 2-3: zatwierdzenie przez uprawnioną osobę, zabezpieczenia oparte na z góry ustalonych regułach i pełny rejestr działań, niezależnie od klasy modelu. Tabela pomaga wybrać rozwiązania do pilotażu. Ostateczną decyzję podejmuje się po porównaniu ich wyników na tym samym zbiorze rzeczywistych przypadków. 8. ChatGPT, zintegrowany LLM, SLM i automatyzacja: przykłady zastosowań w firmie Przykładowy proces Rekomendowana architektura Najważniejszy KPI Kontrola człowieka Pierwsza wersja treści marketingowej Firmowy asystent LLM Mediana oszczędności czasu i odsetek zaakceptowanych wyników Akceptacja każdej publikacji Podsumowanie spotkania i lista działań Firmowy asystent z dostępem do zatwierdzonego źródła Kompletność zadań i liczba korekt Weryfikacja właścicieli i terminów Odpowiedzi na pytania o procedury wewnętrzne Zintegrowany LLM z RAG i cytowaniem źródeł Odsetek odpowiedzi opartych na źródłach i poprawność odwołań do źródeł Eskalacja przy braku źródła Klasyfikacja zgłoszeń do stałych kolejek SLM lub klasyfikator, LLM dla wyjątków Macro-F1 i odsetek wykrytych zgłoszeń priorytetowych Weryfikacja przypadków budzących wątpliwości Analiza umów według firmowej listy ryzyk Zintegrowany LLM z RAG, regułami i logami Odsetek wykrytych oraz przeoczonych klauzul ryzykownych Decyzja prawnika Ekstrakcja pól z jednego typu faktury OCR, klasyczne ML lub SLM oraz walidator reguł Dokładność na poziomie pola i koszt przetworzenia dokumentu Kontrola wyjątków Przygotowanie oferty na podstawie CRM i cennika Zintegrowany LLM, RAG i pobieranie cen według z góry ustalonych reguł Czas przygotowania i odsetek korekt handlowych Akceptacja ceny i warunków Sprawdzenie prawa do zwrotu Reguły procesu Zgodność z polityką i czas decyzji Obsługa wyjątków Wykonanie zwrotu pieniędzy Workflow transakcyjny i autoryzacja 100% zgodności księgowej i pełny audyt Zależna od kwoty i ryzyka Lokalna analiza komunikatów maszyny SLM lub model specjalistyczny na edge Czas odpowiedzi p95, odsetek wykrytych alarmów i dostępność bez połączenia z internetem Eskalacja alarmów krytycznych Odebranie dostępu odchodzącemu pracownikowi IAM i deterministyczny workflow Kompletność odebranych uprawnień Zatwierdzenie według polityki Wieloetapowa obsługa sprawy klienta Agent AI z ograniczonym zestawem narzędzi Skuteczność realizacji zadań, poprawność użycia narzędzi i odsetek spraw przekazanych pracownikowi Punkty zatwierdzenia dla działań o wysokim wpływie 9. Jak mierzyć efekty wdrożenia AI? Wskaźniki jakości, czasu i kosztów Pomiar zaczyna się od obecnego procesu. Badanie Generative AI at Work, obejmujące 5 179 pracowników obsługi klienta, wykazało średni wzrost liczby rozwiązanych spraw na godzinę o 14%. Największą poprawę odnotowano u osób mniej doświadczonych. Tak zdefiniowana produktywność ma jasny licznik, mianownik i grupę odniesienia. Podobnej precyzji potrzebuje firmowy pilotaż. Obszar Wskaźnik Sposób pomiaru Skala Wolumen spraw Liczba przypadków miesięcznie, sezonowość i okresy największego obciążenia Czas Czas obsługi sprawy Średnia, mediana i p90 przed wdrożeniem oraz po nim Jakość Task success rate Odsetek przypadków spełniających wszystkie kryteria poprawnego wykonania zadania Użyteczność Odsetek wyników przyjętych bez zmian merytorycznych Odsetek wyników przyjętych bez zmiany merytorycznej Kontrola Odsetek decyzji AI zmienionych przez pracownika Odsetek decyzji lub propozycji zmienionych przez pracownika Ryzyko Częstotliwość błędów krytycznych Liczba błędów krytycznych na 1 000 lub 10 000 przypadków Klasyfikacja Precyzja, czułość i miara F1 Osobno dla każdej ważnej klasy, zwłaszcza rzadkich zdarzeń RAG Zgodność odpowiedzi ze źródłami Odsetek twierdzeń wspartych wskazanym, aktualnym źródłem Agent Poprawność wyboru narzędzi i przekazywanych parametrów Poprawny wybór narzędzia oraz poprawność przekazanych parametrów Automatyzacja Odsetek spraw obsłużonych w pełni automatycznie Odsetek spraw zakończonych bez ręcznej interwencji Wydajność Czas od rozpoczęcia zadania do uzyskania ostatecznego wyniku p50 i p95 od rozpoczęcia do ostatecznego wyniku Ekonomia Koszt poprawnie zakończonego zadania Pełny koszt podzielony przez liczbę poprawnych rezultatów Stabilność Zmiany jakości działania systemu w czasie Zmiana jakości według czasu, języka, kategorii i typu użytkownika Google Cloud wskazuje koszt poprawnie zakończonego zadania jako kluczowy miernik agentów AI działających w rzeczywistych procesach biznesowych. Model kosztujący 0,10 USD na uruchomienie i osiągający 50% skuteczności generuje sam koszt wywołań na poziomie 0,20 USD na poprawny wynik. Do rachunku dochodzą weryfikacja przez pracownika, ponowne próby, integracje, monitoring oraz koszt błędów. 10. Jak obliczyć ROI wdrożenia LLM lub SLM? Pełny koszt rozwiązania powinien obejmować budowę i integrację, model lub API, infrastrukturę, monitoring, aktualizacje, weryfikacja przez pracownika, poprawki oraz oczekiwaną stratę wynikającą z błędów. Koszt poprawnie zakończonego zadania: C_success = (koszt budowy przypisany do okresu + model/API + infrastruktura + monitoring + kontrola człowieka + poprawki + oczekiwana strata błędów) / liczba poprawnie zakończonych zadań Roczna korzyść: Korzyść = oszczędzony czas pracy + uniknięte poprawki i błędy + dodatkowa marża + uniknięte kary SLA ROI: ROI = (Korzyść - TCO rozwiązania AI) / TCO rozwiązania AI × 100% Załóżmy, że zespół klasyfikuje 20 000 zgłoszeń miesięcznie. Jedno zgłoszenie zajmuje średnio 4 minuty, a pełny koszt godziny pracy wynosi 120 zł. Miesięczny koszt ręcznej klasyfikacji wynosi około 160 000 zł. W pilotażu system osiąga 88% wyników zaakceptowanych bez korekty, weryfikacja jednego wyniku trwa średnio 45 sekund, poprawa pozostałych przypadków zajmuje 3 minuty, a miesięczne koszty modelu, infrastruktury, utrzymania i amortyzowanego wdrożenia wynoszą 51 000 zł. przegląd wszystkich przypadków: około 30 000 zł, poprawa 12% przypadków: około 14 400 zł, model, infrastruktura, utrzymanie i wdrożenie: 51 000 zł, łączny koszt procesu po wdrożeniu: około 95 400 zł, miesięczna różnica kosztu: około 64 600 zł, czyli 40,4%. To przykład metodologiczny z założonymi wartościami. W analizie opłacalności rzeczywistego wdrożenia trzeba uwzględnić zmianę kosztu błędów, sezonowość, czas przestojów, koszt obsługi wyjątków oraz tempo, w jakim pracownicy zaczynają korzystać z rozwiązania. Dla procesu generującego przychód rachunek powinien uwzględniać również zmianę marży, współczynnika konwersji albo wskaźnika utrzymania klientów 11. Jak przeprowadzić mierzalny pilotaż LLM lub SLM? Zapisz punkt odniesienia. Zmierz wolumen, czas, jakość, błędy, eskalacje i koszt obecnej metody przez co najmniej jeden pełny cykl biznesowy. Przygotuj zestaw przypadków testowych. Uwzględnij typowe zadania, trudne i rzadkie sytuacje, przypadki na granicy dopuszczalnych warunków oraz próby celowego wprowadzenia systemu w błąd. Google Cloud zaleca własny zbiór odzwierciedlający pełne spektrum użycia. Ustal progi przed testem. Zapisz minimalną jakość, maksymalny koszt, dopuszczalną latencję, limit błędów krytycznych i zasady eskalacji. Porównaj kilka wariantów. Uwzględnij obecny proces, mocny LLM, mniejszy model oraz architekturę hybrydową. Uruchom system w trybie obserwacyjnym (shadow mode). AI przygotowuje wyniki równolegle do dotychczasowego procesu. Decyzje i działania nadal przebiegają według obowiązujących zasad. Pozwala to wykryć błędy przed dopuszczeniem AI do obsługi rzeczywistych operacji. Uruchom system w ograniczonym zakresie. Rozpocznij od propozycji i zatwierdzeń. Zakres automatycznych działań rozszerzaj na podstawie wyników. Monitoruj jakość działania. Ponawiaj testy po zmianie modelu, instrukcji dla AI, narzędzi, źródeł danych, reguł lub rodzaju przetwarzanych materiałów. 11.1 Ile przypadków testowych potrzeba do oceny LLM lub SLM? Dla wskaźnika wyrażonego jako odsetek, przy poziomie ufności 95% i marginesie błędu +/-5 punktów procentowych, konserwatywna wielkość próby wynosi około 385 niezależnych przypadków. Margines +/-3 punkty procentowe wymaga około 1 068 przypadków. Próba reprezentatywna powinna zostać uzupełniona osobnym zestawem przypadków krytycznych i brzegowych. Przy rzadkich błędach istotna jest tak zwana reguła trzech. Jeżeli w 300 testach nie pojawi się żaden błąd krytyczny, przybliżona górna granica jego rzeczywistego prawdopodobieństwa na poziomie ufności 95% nadal wynosi około 1%. Zero błędów w 3 000 testów obniża tę granicę do około 0,1%. W procesach wysokiego ryzyka potrzebne są więc znacznie większe zbiory oraz testy ukierunkowane na konkretne zagrożenia. 11.2 Kiedy zakończyć pilotaż AI i uruchomić system w firmie? Przykładowe kryteria Proces Przykładowe kryteria przejścia do produkcji odsetek przypisań zmienionych przez pracownika do 8% Macro-F1 co najmniej 0,90; recall zgłoszeń priorytetowych co najmniej 0,99; override rate do 8%; p95 do 2 sekund Wewnętrzna baza wiedzy Acceptance rate co najmniej 85%; poprawność cytowań co najmniej 98%; brak niepopartych twierdzeń w zestawie krytycznym; p95 do 8 sekund Projekt oferty Mediana czasu niższa o co najmniej 30%; co najmniej 75% materiałów przyjętych z drobnymi zmianami; 100% cen pobranych z autoryzowanego źródła; zatwierdzenie człowieka dla każdej oferty Podane wartości są przykładem konstrukcji kryteriów. Właściciel procesu ustala progi zgodnie z kosztem błędu, wymaganą jakością i tolerancją ryzyka organizacji. 12. Jak dobrać zakres nadzoru człowieka do ryzyka związanego z AI? NIST definiuje ryzyko jako połączenie prawdopodobieństwa zdarzenia i skali jego konsekwencji. Ta zasada pozwala przełożyć ogólne obawy związane z AI na mierzalny model: częstotliwość błędów, wartość środków lub zasobów narażonych na stratę, możliwość cofnięcia działania, czas wykrycia błędu i koszt jego naprawy W skonsolidowanym tekście unijnego AI Act wymagania dla systemów wysokiego ryzyka obejmują ciągłe zarządzanie ryzykiem, odpowiedni poziom dokładności, odporności i cyberbezpieczeństwa oraz skuteczny nadzór człowieka. Środki nadzoru mają być proporcjonalne do ryzyka, poziomu autonomii i kontekstu użycia. Testy powinny korzystać z uprzednio zdefiniowanych metryk i progów właściwych dla zamierzonego zastosowania. W praktyce biznesowej oznacza to przypisanie konkretnej osoby do zatwierdzania, monitorowania i reagowania. Interfejs powinien pokazywać źródła, wykonane działania i poziom niepewności, a użytkownik musi mieć możliwość zatrzymania procesu. Ryzyko poważnych konsekwencji błędu uzasadnia ograniczenie uprawnień modelu, dodatkowe sprawdzanie wyników i dłuższe testy w trybie obserwacyjnym. Klasyfikację regulacyjną należy ustalić osobno dla zamierzonego zastosowania i roli organizacji. 13. Jak połączyć LLM, SLM i reguły w jednym procesie biznesowym? Połączenie kilku technologii pozwala dopasować sposób obsługi do poszczególnych etapów procesu. Przykładowo SLM rozpoznaje temat zgłoszenia klienta, a LLM przygotowuje odpowiedź na podstawie historii kontaktu i dokumentów pobranych przez RAG. Gdy sprawa dotyczy zwrotu pieniędzy, system sprawdza warunki i limity zgodnie z ustalonymi regułami, a następnie kieruje operację do realizacji lub zatwierdzenia przez uprawnionego pracownika. Tak zaprojektowana obsługa łączy automatyzację z kontrolą decyzji mających skutki finansowe. W TTMS pomożemy Ci ocenić, gdzie podobne rozwiązanie przyniesie największą korzyść. Zaczniemy od zadań, które pochłaniają najwięcej czasu: powtarzalnych czynności, wyszukiwania informacji czy poprawiania błędów. Podczas konsultacji przeanalizujemy przebieg pracy, dostępne dane i wykorzystywane systemy. Na tej podstawie zaproponujemy technologię i zakres pilotażu, a wspólnie z Tobą ustalimy oczekiwane efekty oraz sposób pomiaru jakości, czasu i kosztów. Chcesz wybrać pierwszy proces do usprawnienia? Umów się z nami na konsultację dotyczącą wdrożenia AI. Źródła Eurostat, 20% of EU enterprises use AI technologies, 11 grudnia 2025. Fabrizio Dell’Acqua et al., Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality, Organization Science. Erik Brynjolfsson, Danielle Li, Lindsey Raymond, Generative AI at Work, NBER Working Paper 31161, 2023. Joel Becker, Nate Rush, Beth Barnes, David Rein, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, METR, 10 lipca 2025. Microsoft Azure, What Are Small Language Models (SLMs)?. Microsoft Azure, Boost processing performance by combining AI models, 8 stycznia 2025. OpenAI, Enterprise privacy at OpenAI. Google Cloud, The KPIs that actually matter for production AI agents, 26 lutego 2026. NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, lipiec 2024. Unia Europejska, Rozporządzenie (UE) 2024/1689, tekst skonsolidowany z 27 lipca 2026. OWASP GenAI Security Project, LLM06:2025 Excessive Agency, 2025. FAQ Czy do pracy na danych firmowych trzeba uruchamiać własny model AI? Własny model jest jednym z dostępnych wariantów. Firmy mogą korzystać z zatwierdzonego środowiska biznesowego, zarządzanego API, prywatnej chmury, wydzielonej infrastruktury lub modelu działającego lokalnie. Wybór zależy od klasy danych, lokalizacji przetwarzania, retencji, szyfrowania, tożsamości użytkowników, wymogów branżowych i umowy z dostawcą. Przykładowo OpenAI deklaruje brak domyślnego trenowania na danych klientów biznesowych i oferuje dodatkowe mechanizmy kontroli retencji dla kwalifikujących się klientów API. Organizacja powinna udokumentować przepływ danych dla konkretnej konfiguracji, ponieważ nazwa modelu nie opisuje całej architektury bezpieczeństwa. Czy RAG może zastąpić fine-tuning modelu na danych firmy? RAG i fine-tuning rozwiązują różne problemy. RAG pobiera aktualne informacje z kontrolowanego źródła w momencie tworzenia odpowiedzi, dzięki czemu dobrze pasuje do baz wiedzy, procedur, dokumentacji i treści często aktualizowanych. Fine-tuning dostosowuje zachowanie modelu do przykładów, stylu, formatu albo wyspecjalizowanego zadania. Dokumentacja AWS porównująca RAG i fine-tuning rekomenduje rozpoczęcie systemu pytań i odpowiedzi na własnych dokumentach od RAG, zwłaszcza gdy ważne są aktualność i odwołania do źródeł. Oba mechanizmy mogą działać razem, jeśli proces wymaga zarówno aktualnej wiedzy, jak i stabilnego zachowania domenowego. Czy jeden proces może korzystać jednocześnie z LLM i SLM? Tak. Router może kierować typowe, dobrze rozpoznane sprawy do SLM, a przypadki złożone do większego LLM. Trzecia ścieżka prowadzi do człowieka, gdy system wykryje brak danych, niską pewność albo wysoki poziom ryzyka. Innym wariantem jest podział procesu według funkcji: SLM klasyfikuje dokument, LLM przygotowuje wyjaśnienie, kod oblicza wartości, a workflow zapisuje zatwierdzoną decyzję. Taki układ pozwala kontrolować koszty i czas reakcji przy zachowaniu dostępu do większych możliwości w trudniejszych sprawach. Ile przykładów potrzeba do pilotażu LLM lub SLM? Liczba zależy od oczekiwanej precyzji pomiaru i rzadkości błędów. Dla odsetka skutecznych odpowiedzi próba około 385 niezależnych przypadków daje przybliżony margines +/-5 punktów procentowych przy poziomie ufności 95% w wariancie konserwatywnym. Margines +/-3 punkty wymaga około 1 068 przypadków. Losowa próba powinna odzwierciedlać rzeczywisty wolumen, języki, kanały i typy użytkowników. Osobny zestaw powinien obejmować przypadki krytyczne, brzegowe, rzadkie oraz próby manipulacji systemem. Jak często trzeba ponownie testować aplikację opartą na modelu językowym? Pełna ewaluacja powinna zostać uruchomiona po zmianie modelu, wersji promptu, narzędzia, uprawnień, źródła danych, reguł biznesowych lub formatu wejścia. Produkcja wymaga również ciągłego monitorowania najważniejszych KPI oraz cyklicznego testu regresji. Częstotliwość zależy od ryzyka i tempa zmian procesu. Aplikacja obsługująca treści marketingowe może mieć inny harmonogram niż system wspierający decyzje finansowe. Praktycznym rozwiązaniem jest automatyczny test przy każdej zmianie technicznej, miesięczny przegląd trendów oraz kwartalna ewaluacja biznesowa, z krótszym cyklem dla zastosowań wysokiego ryzyka.
CzytajGPT-6 Astra w Microsoft 365 Copilot: dostęp, zadania i koszty Cowork
Masz w firmie Copilota i chcesz wypróbować GPT-6 Astra? Model OpenAI jest dostępny także w Copilot Cowork. Możesz więc sprawdzić go przy pracy z dokumentami, pocztą i kalendarzem w środowisku Microsoftu. Dostęp do Astry zależy od licencji i ustawień organizacji, a wykonywanie zadań w Cowork wiąże się z rozliczaniem zużycia kredytów. Co musi włączyć administrator? Jakie zadania powierzysz Astrze w Cowork, a jak wygląda ich wykonanie w ChatGPT Work? Poniżej znajdziesz warunki dostępu, różnice w pracy na plikach i zasady naliczania opłat. Kwestię wyboru asystenta dla organizacji omawiamy w naszym porównaniu Microsoft Copilot i ChatGPT dla firm. 1. Co GPT-6 Astra wnosi do Copilot Cowork? Microsoft wymienia GPT-6 Astra na liście modeli Copilot Cowork. Użytkownik wybiera model z listy udostępnionej przez organizację. Domyślne ustawienie Auto pozwala Cowork dobrać model do zadania; oznaczenie przy odpowiedzi pokazuje, którego użyto. Wybór Astry dotyczy pracy w Cowork. Dostępność konkretnego modelu w pozostałych funkcjach Copilota trzeba sprawdzać osobno. GPT-6 Astra jest kolejnym modelem, któremu możesz powierzyć zadanie w Cowork. Sam Cowork zapewnia narzędzia do wyszukiwania materiałów, tworzenia plików i wykonywania czynności w Microsoft 365. Wybór modelu może wpłynąć na sposób analizy, szczegółowość odpowiedzi i czas pracy. Przy ocenie Astry warto więc sprawdzić, czy lepiej radzi sobie z zadaniem, które już wykonujesz: poprawniej łączy ustalenia, uwzględnia wyjątki i przygotowuje wynik wymagający mniej poprawek. Work IQ zapewnia Cowork dostęp do kontekstu firmowej pracy. Przy przygotowaniu podsumowania projektu potrzebne informacje mogą znajdować się w dokumentach, korespondencji i materiałach ze spotkań. Cowork może wyszukiwać firmowe zasoby potrzebne do zadania. Dlatego przed próbą warto sprawdzić, czy konto pracownika ma dostęp do właściwych materiałów i czy znajdują się wśród nich aktualne ustalenia. Od tego zależy, na jakich informacjach Astra oprze wynik. Wyniki testów modelu i przykłady jego wykorzystania opisujemy w artykule GPT-6 Astra: imponujące osiągnięcia, nowe możliwości dla biznesu. 2. Jak uzyskać dostęp do Astry w Copilot Cowork? Dla użytkowników biznesowych Microsoft opisuje Cowork jako usługę wymagającą licencji Microsoft 365 Copilot oraz rozliczania wykonywanych zadań według zużycia. Administrator musi następnie skonfigurować dostęp pracowników. W konfiguracji są dwa osobne ustawienia: Dostęp do Cowork. Pracownik musi należeć do grupy objętej zasadą wydatków, która uwzględnia Cowork. Administrator ustawia ją w centrum administracyjnym Microsoft 365, w obszarze Copilot, Cost Management, Configuration. To tutaj określa użytkowników, budżet i sposób rozliczenia. Dostęp do modeli obsługiwanych przez OpenAI. W ustawieniach Copilota administrator określa, którzy użytkownicy mogą korzystać z OpenAI jako podwykonawcy Microsoftu. Po uzyskaniu dostępu otwórz Cowork i wybierz Astrę z listy modeli. Przy pierwszym zadaniu sprawdź oznaczenie modelu przy odpowiedzi. Jeżeli pracownik widzi Cowork, ale brakuje mu Astry, administrator powinien sprawdzić ustawienia dostawcy modeli. Aby udostępnić Cowork wybranemu zespołowi, administrator musi objąć dostępem właściwą grupę użytkowników. Niski limit kredytów ogranicza wydatki, ale nadal pozwala objętemu nim pracownikowi rozpocząć pracę. 3. Astra w Cowork i ChatGPT Work: różnice przy wykonywaniu zadania Przy przygotowaniu raportu trzeba dotrzeć do aktualnych danych, opracować je i zapisać wynik w miejscu dostępnym dla zespołu. Na każdym z tych etapów znaczenie mają narzędzia udostępnione modelowi. Poniższe zestawienie pokazuje, jak oba środowiska pracują z materiałami potrzebnymi do zadania. Praca z materiałami w Copilot Cowork i ChatGPT Work Element zadania Copilot Cowork ChatGPT Work Odnalezienie materiałów Wyszukiwanie w zasobach Microsoft 365 dostępnych użytkownikowi, w tym w poczcie i plikach. Wtyczki mogą udostępniać kolejne źródła. Pliki przekazane do zadania oraz informacje pobrane przez włączone aplikacje i autoryzowane konta. Opracowanie dokumentów Tworzenie i zmiana dokumentów, arkuszy i prezentacji. Pliki wynikowe trafiają do obszaru pracy w OneDrive lub SharePoint. Tworzenie i edycja plików. Przekazanie ich do innego systemu zależy od operacji dostępnych w połączeniu z tym systemem. Pliki na dysku komputera Można przesłać plik do sesji. Cowork nie edytuje plików bezpośrednio na dysku użytkownika. Work w obsługiwanej aplikacji komputerowej może korzystać z lokalnych plików po udzieleniu odpowiedniego dostępu. Obsługa programu przez przeglądarkę Lokalna przeglądarka Edge korzysta z istniejącego logowania pracownika. Funkcja wymaga włączenia przez administratora. Dostęp zależy od wybranego narzędzia przeglądarkowego i udzielonych zgód. Zadanie w chmurze wymaga osobnej autoryzacji do firmowych zasobów. Przy pracy w przeglądarce trzeba uwzględnić miejsce uruchomienia zadania. Cowork obsługuje lokalną przeglądarkę w swojej wersji webowej otwartej w Edge. Ta funkcja nie działa obecnie w aplikacji komputerowej Copilota ani na urządzeniach mobilnych. Potrzebne jest też to samo konto służbowe w Cowork i Edge. Uśpienie komputera może wstrzymać czynności wymagające lokalnej przeglądarki. W ChatGPT Work podczas zadania lokalnego model może korzystać z udostępnionych plików i aplikacji komputera. Zadanie uruchomione w chmurze działa w osobnym środowisku. Jeśli potrzebne materiały znajdują się wyłącznie na dysku pracownika lub są dostępne przez firmowy VPN, trzeba udostępnić je temu środowisku w obsługiwany sposób. Podczas pracy Cowork pokazuje kolejne etapy zadania. Możesz przerwać sesję, doprecyzować polecenie lub dostarczyć brakujące informacje. Przed ważnymi działaniami, takimi jak wysłanie wiadomości czy zaplanowanie spotkania, Cowork prosi o zatwierdzenie. Zakres kolejnych pytań zależy również od udzielonych wcześniej zgód. Do pierwszej próby wybierz zadanie, którego materiały i miejsce zapisu wyniku możesz jednoznacznie wskazać. Przykłady obowiązków w sprzedaży, HR, finansach i innych działach znajdziesz w naszym zestawieniu 10 praktycznych zastosowań Microsoft Copilot w organizacji. 4. Ile kosztuje korzystanie z Astry w Cowork i ChatGPT Work? W budżecie trzeba uwzględnić abonament oraz wykorzystanie narzędzi do wykonywania zadań. W firmie, która ma już odpowiednie licencje, uruchomienie Cowork oznacza przede wszystkim zaplanowanie opłat za jego użycie. Poniżej podajemy publiczne ceny wybranych planów biznesowych. Ceny abonamentów. Opłaty za wykonywanie zadań opisujemy poniżej. Plan Cena za osobę miesięcznie Warunki Microsoft 365 Copilot Business 18,20 EUR; obecnie 15,60 EUR w promocji Płatność roczna, ceny netto. Potrzebna osobna, kwalifikująca się licencja Microsoft 365. Oferta dla maksymalnie 300 użytkowników. Microsoft 365 Copilot w ofercie dla przedsiębiorstw 26 EUR Płatność roczna, cena netto. Potrzebna osobna, kwalifikująca się licencja Microsoft 365. ChatGPT Business 20 USD przy płatności rocznej lub 25 USD przy miesięcznej Minimum dwóch użytkowników. Publiczna cena w USD; końcowa kwota zależy m.in. od podatków i rynku zakupu. ChatGPT Enterprise Wycena indywidualna Limity i rozliczenie wykorzystania określa umowa. Promocja Copilot Business obejmuje pierwszy rok przy zobowiązaniu rocznym i obowiązuje od 1 lipca do 31 grudnia 2026 r. 4.1 Jak naliczane są opłaty za zadania Cowork? Cowork rozlicza m.in. użycie modelu, pobieranie kontekstu, wywołania narzędzi i czas działania. Zużycie jest przeliczane na Copilot Credits; w opublikowanej ofercie pay-as-you-go jeden kredyt kosztuje 0,01 USD. Tysiąc kredytów oznacza więc 10 USD. Koszt pojedynczego zadania zależy od liczby zużytych kredytów. Na zużycie wpływa również wybrany poziom rozumowania. W Cowork dostępne są ustawienia Light, Medium, High, Extra High i Max. Wyższy poziom może wydłużyć zadanie i zwiększyć zużycie kredytów. Przy powtarzalnej pracy sprawdź, czy podniesienie tego ustawienia poprawia rezultat na tyle, by uzasadnić koszt. 4.2 Co oznacza zużycie kredytów w ChatGPT Work? ChatGPT Work korzysta z limitów i zasad rozliczania właściwych dla planu. W umowach opartych na wspólnej puli kredytów zadania zmniejszają dostępne saldo. Wykorzystanie kredytów już opłaconych w umowie jest pokryte tą opłatą. Dodatkowy koszt może powstać po ich wyczerpaniu, jeżeli umowa i ustawienia pozwalają kontynuować pracę. Przy porównywaniu kosztów użyj tej samej grupy zadań i wymagań dotyczących wyniku. Zapisz zużycie, liczbę ponownych prób oraz zakres poprawek. Przeliczenie wydatków na poprawnie ukończone zadanie pokaże, ile kosztuje wynik, z którego zespół może korzystać. Liczbę kredytów każdej usługi trzeba najpierw przeliczyć według jej własnego cennika. 5. Jakie zasady ochrony danych dotyczą Astry w Cowork? W Copilot Cowork Astra jest obsługiwana przez OpenAI jako podwykonawcę Microsoftu. Według dokumentacji do tego sposobu korzystania z modelu stosuje się warunki Microsoftu i jego dodatek dotyczący ochrony danych, z określonymi wyłączeniami. Usługi te są objęte EU Data Boundary z opisanymi wyjątkami. Microsoft wyłącza je obecnie z zobowiązań dotyczących przetwarzania w konkretnym kraju. Ten szczegół ma znaczenie dla organizacji wymagających np. przetwarzania wyłącznie w Polsce. Przy uruchomieniu Astry administrator powinien więc uwzględnić zasady dostawcy modelu oraz dostęp do materiałów używanych w zadaniu. W ChatGPT Work dodatkowo znaczenie ma lokalny lub chmurowy sposób pracy. Podczas zadania lokalnego fragmenty plików, zrzuty ekranu i wyniki narzędzi mogą być przesyłane do OpenAI. Firmowe zasady korzystania z AI powinny uwzględniać również ten sposób przekazywania informacji. 6. Od jakiego zadania zacząć korzystanie z Astry? Zacznij od obowiązku, przy którym pracownik regularnie zbiera informacje i przygotowuje materiał dla innych osób. Taki przebieg pracy pozwala sprawdzić zarówno analizę Astry, jak i dostępne w Cowork lub Work narzędzia. Przykładem może być cotygodniowe podsumowanie projektu. Przykład polecenia do własnej próby: Na podstawie folderu projektu [link] i korespondencji dotyczącej tego projektu z ostatnich siedmiu dni przygotuj raport dla kierownika. Wymień zmienione terminy, otwarte decyzje i osoby odpowiedzialne za kolejne działania. Przy każdym ustaleniu podaj źródło i datę. Jeśli materiały zawierają sprzeczne informacje, pokaż rozbieżność i wskaż, czego potrzebujesz do jej rozstrzygnięcia. Zapisz raport jako DOCX według załączonego szablonu w folderze [link]. Przygotuj szkic wiadomości do [odbiorcy] z linkiem do raportu. Wysyłkę pozostaw do mojego zatwierdzenia. Sprawdź, czy raport uwzględnia najnowsze ustalenia, podaje ich źródła i daty, wskazuje sprzeczne informacje oraz poprawnie przypisuje odpowiedzialność. Oceń też zgodność z szablonem i sprawdź, czy plik zapisano w folderze dostępnym dla odbiorców. Po udanej próbie można rozważyć regularne uruchamianie zadania. Cowork obsługuje harmonogramy oraz zadania wyzwalane m.in. wiadomością e-mail lub wpisem w Teams. Domyślnie zadania wyzwalane zdarzeniem przygotowują działania do zatwierdzenia. Projektowanie całego procesu omawiamy w przewodniku po automatyzacji procesów biznesowych z Copilotem. 7. Przygotuj z TTMS pierwsze zadania dla Astry W ramach konsultingu AI pomagamy ustalić, jakie dane będą potrzebne do zadania, które narzędzia trzeba udostępnić i jak sprawdzić rezultat. Analizujemy także wymagane licencje oraz sposób rozliczania wykorzystania. Łączymy doradztwo z projektowaniem rozwiązań AI i integracją firmowych systemów. TTMS jako pierwsza firma w Polsce uzyskała akredytowaną certyfikację ISO/IEC 42001 dla systemu zarządzania sztuczną inteligencją. Audyt TÜV Nord Poland objął zasady projektowania i wykorzystywania AI, w tym zarządzanie ryzykiem i dokumentowanie projektów. Powiedz nam, jakie zadanie chcesz powierzyć Astrze i z jakich programów korzysta Twój zespół. Porozmawiaj z TTMS o konsultingu AI dla Twojej firmy. GPT-6 Astra w Copilot Cowork: najczęstsze pytania Czy wybór Astry w Cowork zmienia model we wszystkich aplikacjach Copilota? Wybór dotyczy pracy w Cowork. Microsoft opisuje osobny wybór modelu w tym środowisku. Model obsługujący konkretną funkcję w Wordzie, Excelu lub Teams wymaga sprawdzenia w dokumentacji tej funkcji. Przy sprawdzaniu zadania Cowork można odczytać oznaczenie użytego modelu przy odpowiedzi. Czy ten sam model da identyczną odpowiedź w Copilocie i ChatGPT? Wynik może być różny. Model pracuje na informacjach udostępnionych przez dany produkt i korzysta z jego narzędzi, instrukcji oraz ustawień rozumowania. Przy porównaniu trzeba więc sprawdzić, jakie materiały otrzymał i jakie czynności mógł wykonać. Dopiero wtedy można sensownie ocenić różnicę w rezultatach. Dlaczego widzę Cowork, ale nie mogę wybrać GPT-6 Astra? Dostęp do Cowork i dostęp do modeli OpenAI mają osobne ustawienia. Administrator powinien potwierdzić, że Twoje konto może korzystać z modeli obsługiwanych przez OpenAI jako podwykonawcę Microsoftu. Lista modeli widoczna w Cowork odzwierciedla dostęp przyznany przez organizację. Czy abonament Microsoft 365 Copilot obejmuje wszystkie zadania Cowork? Zadania Cowork podlegają dodatkowo rozliczeniu według wykorzystania. Na zużycie Copilot Credits wpływają m.in. model, pobieranie informacji i narzędzia. Administrator może ustalać zasady wydatków dla użytkowników i grup. Przy planowaniu budżetu trzeba uwzględnić abonament oraz przewidywane użycie Cowork. Czy Astra w Cowork może edytować dokument zapisany na moim komputerze? Możesz przesłać dokument do sesji Cowork. Według aktualnego FAQ usługa nie otwiera ani nie edytuje plików bezpośrednio na lokalnym dysku. Cowork pracuje na przekazanych materiałach oraz plikach dostępnych w OneDrive i SharePoint. Obsługa przeglądarki Edge jest osobną funkcją. Czy ten sam model Astra zapewni taki sam wynik w Cowork i ChatGPT Work? Na wynik wpływają także dostępne dane, instrukcje, narzędzia i ustawienia rozumowania. Dlatego zadanie wykonane z tym samym modelem może przebiegać inaczej w obu środowiskach. Porównanie na tych samych materiałach pokaże, gdzie pojawiają się różnice w kompletności wyniku i wykonanych czynnościach.
CzytajGPT-6 Astra: imponujące osiągnięcia, nowe możliwości dla biznesu
3 września 2026 r. OpenAI zaprezentowało GPT-6 Astra, a pierwsze wyniki badań i relacje użytkowników pokazują, dlaczego ta premiera wzbudza tyle emocji. Nowy model znalazł rozwiązania problemów matematycznych, z którymi w tym samym teście nie poradziły sobie poprzednie wersje GPT, jak również konkurencja. Użytkownicy sprawdzili już GPT-6 w różnych zastosowaniach: od przebudowy procesu sprzedaży w CRM, przez stworzenie szczegółowego modelu parowozu, po analizę ponad 500-stronicowej powieści. Co dokładnie udało się osiągnąć i co z tych możliwości może wykorzystać biznes? 1. Pierwsze osiągnięcia GPT-6 Astra robią wrażenie Pierwsze testy i relacje użytkowników pokazują, jak Astra radzi sobie ze złożonymi zadaniami. Są wśród nich wyniki testu przeprowadzonego przez Epoch AI oraz doświadczenia osób, które powierzyły modelowi własne projekty. 1.1 Rozwiązanie dwóch dotąd nierozstrzygniętych problemów matematycznych Epoch AI zleciło pięciu modelom rozwiązanie 68 problemów Erdősa, zapewniając każdemu takie same limity czasu i budżetu. Tylko przedpremierowa wersja Astry rozwiązała dwa z nich i zapisała rozwiązania w formie, która przeszła automatyczną weryfikację matematyczną. GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 i Claude Fable 5 nie rozwiązały w tym teście żadnego problemu. To zresztą nie pierwsze matematyczne osiągnięcia Astry. Jeszcze przed premierą OpenAI przedstawiło dziesięć innych wyników modelu dotyczących problemów z matematyki i informatyki teoretycznej. Opisaliśmy je w artykule „Astra, przyszły GPT-6: nowy model od OpenAI?”. 1.2 Model 3D parowozu z 3295 edytowalnych elementów Tom Krcha, projektant i twórca narzędzia Pencil do pracy nad interfejsami z pomocą AI, przekazał Astrze stary rysunek parowozu. Model miał na jego podstawie odtworzyć maszynę w Blenderze, programie służącym do tworzenia modeli, animacji i scen 3D. Po kilku minutach powstała konstrukcja obejmująca 3295 osobnych obiektów. Koła, osie, elementy kotła i pozostałe części można zaznaczać, przesuwać oraz modyfikować niezależnie. Astra musiała zinterpretować płaski rysunek, odtworzyć przestrzenną budowę maszyny i zachować zależności między tysiącami elementów. Według Krchy robiła to głównie przez pisanie skryptów w Pythonie, które tworzyły geometrię część po części. Tak przygotowany model może posłużyć jako baza do animacji lub projektu gry. 1.3 Przebudowa procesu sprzedaży bezpośrednio w CRM Claire Vo, twórczyni platformy ChatPRD, udostępniła Astrze używany przez siebie system zarządzania relacjami z klientami, czyli CRM. Model działał za pośrednictwem Codex i miał zmienić sposób obsługi nowych kontaktów sprzedażowych. Musiał zrozumieć istniejący schemat, znaleźć odpowiednie ustawienia i przebudować reguły działające w wizualnym edytorze. Po zmianach system sam kierował kontakty do Claire lub Zacha, wstawiał do wiadomości link umożliwiający rezerwację spotkania z odpowiednią osobą, a gotowy szkic przesyłał do komunikatora Slack do akceptacji. Nowe reguły miały obowiązywać również przy obsłudze kolejnych kontaktów. 1.4 Nowe funkcje głośnika Bluetooth dzięki Astrze Claire Vo wykorzystała model również do eksperymentu z niewielkim głośnikiem Divoom wyposażonym w ekran z kolorowych pikseli. Chciała wyświetlać na nim własne obrazy i komunikaty. Według jej relacji urządzenie nie udostępniało publicznego API, czyli interfejsu pozwalającego innym programom nim sterować. Trzeba było rozpracować sposób komunikacji ze sprzętem. Astra przygotowała aplikację, dzięki której rysunek tworzony myszą na komputerze pojawiał się na ekranie głośnika. Następnie Astra przygotowała narzędzie do sterowania głośnikiem. Wyszukała też informacje o najnowszym odcinku podcastu, po czym przesłała na ekran urządzenia przewijany tekst i animowaną grafikę. Vo podkreśla, że wcześniejsze próby z innymi modelami pozwalały jej zaledwie wyświetlić prosty komunikat powitalny. Tym razem otrzymała własne oprogramowanie do sterowania urządzeniem, które mogła rozwijać zgodnie ze swoimi pomysłami. 1.5 Sprawdzanie spójności fabuły w ponad 500-stronicowej powieści Jakub Szczęsny z Antywebu przekazał Astrze obszerny szkic własnej książki. Model miał sprawdzić chronologię wydarzeń, logikę fabuły oraz wątki zapowiedziane w jednej części tekstu i rozwinięte wiele rozdziałów później. W tak długim materiale trzeba jednocześnie śledzić losy bohaterów, kolejność zdarzeń, motywacje postaci i konsekwencje wcześniejszych decyzji. Astra porządkowała te zależności i wskazywała miejsca wymagające dopracowania, konsekwentnie sprawdzając cały tekst pod kątem wskazanych problemów. Szczęsny szczególnie docenił jej umiejętność łączenia informacji rozsianych po setkach stron. Podobna umiejętność przydaje się przy czytaniu umów, dokumentacji projektowej i raportów, w których ustalenia z jednej części wpływają na interpretację pozostałych. 1.6 Ukończenie całej gry Portal przez agenta AI Twórca publikujący jako CozyBlaze połączył Astrę z Portalem, przestrzenną grą logiczną, w której gracz tworzy przejścia między odległymi miejscami i wykorzystuje zasady fizyki do pokonywania przeszkód. Model otrzymywał zrzuty ekranu oraz informacje o położeniu postaci i kierunku, w którym była zwrócona. Na tej podstawie planował ruchy, wykonywał je i sprawdzał rezultat. Po około 23 godzinach i 43 minutach, wliczając oczekiwanie oraz przerwy techniczne, dotarł do napisów końcowych. Autor przygotował specjalne sterowanie i ustawienia ułatwiające precyzyjne poruszanie się; gra zatrzymywała się na czas obliczeń. Wznawiał też sesję po problemach z dostępnością usługi, a decyzje dotyczące rozgrywki podejmował agent. Ukończenie gry wymagało rozpoznawania sytuacji na ekranie, orientacji w przestrzeni oraz wielogodzinnego planowania ruchów i sprawdzania ich skutków. Te przykłady pokazują, skąd entuzjazm wokół Astry. Model analizuje problem, wykonuje kolejne czynności i wykorzystuje ich wyniki do dalszego działania. Dla firm otwiera to możliwość powierzania AI bardziej złożonych zadań, wymagających pracy z informacjami i aplikacjami. Porównania z GPT-5.6 pozwalają sprawdzić, gdzie wzrosła skuteczność i jakie może mieć to znaczenie dla biznesu. 2. GPT-6 Astra w biznesie: co większa skuteczność zmienia dla firm? Firma korzystająca z AI ponosi także koszt sprawdzania odpowiedzi, poprawiania błędów i interweniowania, gdy model nie potrafi dokończyć zadania. Dlatego większa skuteczność kolejnej generacji może sprawić, że więcej zadań będzie opłacało się powierzać AI. Wyniki Astry dają podstawę, by ponownie przyjrzeć się podziałowi obowiązków, wykorzystaniu firmowych systemów i czasowi poświęcanemu na kontrolę rezultatów. GPT-6 Astra a GPT-5.6 Sol: wyniki testów i znaczenie dla biznesu Badana umiejętność GPT-6 Astra GPT-5.6 Sol Znaczenie dla firmy Poprawne zakończenie zadania obejmującego kilka aplikacji, AutomationBench 41,4% 28,77% Podstawa do sprawdzenia, czy AI może samodzielnie wykonywać większy fragment procesu. Wskazywanie właściwych elementów na ekranie, ScreenSpot-Pro 92,7% 76,9% Większa precyzja przy obsłudze firmowych programów przez AI. Wykrywanie błędów wymagających analizy kilku plików, trudniejszy podzbiór CodeRabbit 57,1% 47,6% Lepsze wyniki przy analizie złożonych zależności w oprogramowaniu. Wyniki pochodzą z różnych testów i mierzą odrębne umiejętności. AutomationBench: ranking Zapiera z 9 września 2026 r., oba modele w ustawieniu Max. ScreenSpot-Pro: porównanie OpenAI. CodeRabbit: trudniejszy podzbiór przeglądów kodu. Wnioski biznesowe są interpretacją wyników, a oszczędności wymagają sprawdzenia w konkretnym procesie firmy. 2.1 Większy zakres zadań, które można delegować Im więcej etapów obejmuje zadanie, tym więcej okazji do pomyłki. Trzeba odnaleźć informacje, zastosować właściwe zasady, wykonać czynności w odpowiedniej kolejności i zachować spójność ustaleń. Właśnie takie wymagania stawia modelom AutomationBench, test firmowych procesów przygotowany przez Zapier. W rankingu z 9 września 2026 r. Astra poprawnie ukończyła 41,4% zadań, a GPT-5.6 Sol 28,77%, przy najwyższym ustawieniu rozumowania obu modeli. Zadanie zaliczano po spełnieniu wszystkich wymaganych warunków. To około 13 poprawnie zakończonych zadań więcej na każde 100. Dla biznesu oznacza to możliwość sprawdzenia, czy AI wykona więcej etapów bez pomocy pracownika. Warto przyjrzeć się obowiązkom, przy których pracownik stale podpowiada modelowi następny krok, dostarcza kolejne dane lub przenosi wynik do innego programu. Każda taka interwencja zajmuje czas i ogranicza korzyść z automatyzacji. Astra daje powód, by sprawdzić, które z tych etapów potrafi już połączyć. Wynik 41,4% pokazuje też, jak wymagające pozostają te zadania. Zakres samodzielności trzeba ustalić na podstawie rezultatów osiąganych w konkretnym procesie firmy. 2.2 Automatyzacja kolejnych czynności w firmowych programach Firmy korzystają z wielu programów wdrażanych na różnych etapach rozwoju. Dostęp AI do tych zasobów ma duże znaczenie dla jego użyteczności. Gdy model potrafi sprawnie obsługiwać aplikację za pomocą jej interfejsu, można rozważyć jego udział również w czynnościach wykonywanych przez pracowników za pomocą formularzy, przycisków i menu. W ScreenSpot-Pro, teście wskazywania elementów na zrzutach ekranu, Astra osiągnęła 92,7% skuteczności wobec 76,9% GPT-5.6 Sol. Badanie obejmuje rozbudowane programy z gęsto rozmieszczonymi narzędziami. Wynik dotyczy jednej konkretnej umiejętności potrzebnej do obsługi aplikacji. Dzięki tej poprawie warto rozważyć automatyzację kolejnych czynności w programach, z których firma już korzysta. Przy planowaniu automatyzacji warto uwzględnić zadania, które dziś wymagają ręcznego poruszania się po programach. Lepsze rozpoznawanie interfejsu może ułatwić ich wykonanie przez AI wyposażone w odpowiednie narzędzia i uprawnienia. O opłacalności zdecyduje skuteczność całej operacji, wraz z odczytaniem danych, wprowadzeniem zmian i sprawdzeniem wyniku. Precyzyjne wskazanie przycisku jest jednym z warunków jej powodzenia. 2.3 Wykrywanie błędów wymagających połączenia informacji z kilku miejsc W firmowych zadaniach trudność często wynika z powiązań między informacjami. Zmiana jednego ustalenia wpływa na kolejne decyzje, dokumenty i działania zespołu. Osoba odpowiedzialna za całość musi dostrzec te zależności i sprawdzić ich konsekwencje. W badaniu CodeRabbit przewaga Astry była szczególnie widoczna przy analizie błędów wymagających prześledzenia kilku plików kodu. Model wykrył 57,1% oznaczonych błędów wobec 47,6% GPT-5.6 Sol. W całym badaniu różnica była mniejsza: 61,3% wobec 59,0%. Największa poprawa dotyczyła więc trudniejszych przypadków. Dla osób zarządzających wykorzystaniem AI płynie z tego ważna wskazówka: warto oceniać nową generację na zadaniach, przy których wcześniejszy model przeoczał powiązania między informacjami lub wymagał wielu poprawek. Przy prostych poleceniach różnica między modelami może być niewielka. Więcej o przydatności Astry powiedzą materiały z wyjątkami, wzajemnie zależnymi warunkami i informacjami rozproszonymi w kilku miejscach. CodeRabbit dokumentuje tę poprawę w analizie oprogramowania. Sprawdzenie podobnej przewagi w dokumentacji, raportach czy uzgodnieniach biznesowych wymaga prób na własnych materiałach. To dobry kierunek oceny modelu dla firm, w których dużo czasu zajmuje właśnie ustalanie, jak poszczególne informacje wpływają na siebie. 2.4 Kiedy większa skuteczność AI oznacza oszczędności? Nawet niewielka poprawa jakości może mieć znaczenie przy zadaniu powtarzanym setki razy w miesiącu. Jeżeli pracownicy rzadziej poprawiają wynik i rzadziej pomagają AI dokończyć zadanie, zespół odzyskuje czas. Skala tej korzyści zależy od częstotliwości błędów, czasu potrzebnego na ich usunięcie oraz konsekwencji pomyłek. Wyniki Astry uzasadniają ponowną ocenę zastosowań, które wcześniej okazały się zbyt zawodne lub wymagały zbyt dużego nadzoru. Firma może wrócić do odłożonego pomysłu i sprawdzić go na zestawie rzeczywistych spraw, obejmującym także trudniejsze przypadki. W takiej ocenie liczą się trzy rzeczy: odsetek poprawnie zakończonych zadań, czas pracownika poświęcony na kontrolę i poprawki oraz łączny koszt obsługi sprawy. Te wskaźniki pozwalają ustalić, czy większa skuteczność modelu przynosi korzyść całemu zespołowi. Postęp Astry może więc sprawić, że automatyzacja wcześniej zbyt kosztownych zadań zacznie się opłacać. Zadania wymagające dotąd ciągłego wsparcia człowieka zasługują na ponowne sprawdzenie, zwłaszcza gdy są częste, czasochłonne i mają jasno określony wynik. Jak wykorzystać możliwości GPT-6 Astra w Twojej firmie? W ramach konsultingu AI pomagamy wybrać zadania, których usprawnienie przyniesie firmie największą korzyść, i zaplanować wdrożenie. W TTMS wspólnie z klientem analizujemy proces, określamy potrzebne dane i integracje oraz ustalamy, jak ocenić efekty. Łączymy doradztwo z projektowaniem rozwiązań AI i ich integracją z firmowymi systemami. Jako pierwsza firma w Polsce uzyskaliśmy akredytowaną certyfikację ISO/IEC 42001 dla systemu zarządzania sztuczną inteligencją. Dla klientów to potwierdzenie, że stosujemy sprawdzone przez niezależnych audytorów zasady oceny ryzyka, dokumentowania projektów i nadzoru nad AI. Opisz nam zadanie, które chcesz usprawnić. Wspólnie sprawdzimy, jak można wykorzystać w nim AI i od czego zacząć. Porozmawiaj z TTMS o konsultingu AI dla Twojej firmy. GPT-6 Astra w biznesie: najczęstsze pytania Co GPT-6 Astra zmienia dla firm, które już korzystają z AI? GPT-6 Astra daje podstawę do sprawdzenia, czy AI może przejąć większą część zadania i rzadziej wymagać pomocy pracownika. Porównania z GPT-5.6 Sol pokazują poprawę w wykonywaniu czynności obejmujących kilka aplikacji, wskazywaniu elementów ekranu i analizie zależności w kodzie. Warto więc wrócić do procesów, w których zespół często poprawia wyniki lub prowadzi model krok po kroku. Korzyść pojawi się wtedy, gdy większa skuteczność ograniczy nakład pracy potrzebny do uzyskania poprawnego rezultatu. Czy GPT-6 Astra może pracować w firmowych systemach bez budowania nowej integracji? W niektórych przypadkach tak, jeśli środowisko udostępnia Astrze narzędzia do obsługi przeglądarki lub komputera. Model może wtedy wykonywać czynności przez formularze, menu i przyciski aplikacji. Potrzebuje odpowiednich uprawnień oraz dostępu do systemu. Możliwość wykorzystania tego sposobu zależy od konkretnego programu i zadania. Przy częstych, powtarzalnych operacjach warto porównać go z integracją przez API, czyli interfejs umożliwiający bezpośrednią wymianę danych między programami. Które zadania warto ponownie powierzyć AI, jeśli wcześniejsze próby automatyzacji się nie sprawdziły? W pierwszej kolejności te, przy których wcześniejszy model gubił kolejne kroki, mylił elementy interfejsu lub przeoczał zależności między informacjami. To obszary, w których opisane testy pokazują postęp Astry. Do ponownej próby warto wykorzystać te same materiały i kryteria oceny, zachowując także przypadki, które wcześniej sprawiały trudność. Jeżeli przyczyną niepowodzenia były nieaktualne dane, sprzeczne instrukcje lub brak dostępu do aplikacji, te problemy również trzeba rozwiązać. Jak ustalić, co GPT-6 Astra może wykonywać samodzielnie, a co wymaga zatwierdzenia przez pracownika? Zakres samodzielności powinien zależeć od skutków pomyłki, możliwości cofnięcia działania i wyników prób na firmowych danych. Przygotowanie szkicu dokumentu czy uporządkowanie kopii danych pozwala łatwo sprawdzić rezultat przed jego wykorzystaniem. Wysłanie oferty, zmiana warunków handlowych lub usunięcie rekordów może wymagać wcześniejszej akceptacji. W instrukcji procesu warto jasno określić, kiedy AI wykonuje zadanie, kiedy prosi o decyzję i kiedy zatrzymuje się z powodu brakujących informacji. Jak sprawdzić, czy wykorzystanie GPT-6 Astra przynosi firmie oszczędności po uwzględnieniu kontroli i poprawek? Porównaj łączny koszt wykonania tej samej grupy zadań przed zastosowaniem Astry i z jej udziałem. Uwzględnij przygotowanie danych, obsługę narzędzi, sprawdzanie rezultatów, poprawki oraz przypadki wymagające ponownego wykonania przez pracownika. Przydatnym wskaźnikiem jest koszt jednej poprawnie zakończonej sprawy przy zachowaniu wymaganej jakości. Ocenę oprzyj na reprezentatywnym zestawie zadań, obejmującym również wyjątki. Pozwoli to ustalić, czy oszczędności powtarzają się w codziennej pracy.
CzytajOgraniczenia AI w oprogramowaniu dla prawników: ryzyko błędnej porady, pisma i terminu
Prawdziwa sygnatura, za którą kryje się zmyślona teza, to jedna z najbardziej niebezpiecznych halucynacji prawniczych. W czerwcu 2026 roku Naczelny Sąd Administracyjny opisał pismo, w którym zawodowy pełnomocnik powołał trzy istniejące orzeczenia. Problem polegał na tym, że dotyczyły innych zagadnień i nie zawierały przypisanych im tez. Pismo wyglądało wiarygodnie, dopóki ktoś nie otworzył źródeł. Ten przykład dobrze pokazuje praktyczne ograniczenia AI w oprogramowaniu prawniczym. Błąd może wpłynąć na argumentację, ocenę dowodów, termin, poradę dla klienta lub treść pisma procesowego. Za ostateczną treść porady, opinii lub pisma odpowiada prawnik, który je zatwierdza. Ewentualną odpowiedzialność odszkodowawczą ocenia się przez pryzmat należytej staranności zawodowej, zakresu zlecenia oraz okoliczności konkretnej sprawy. W artykule przeczytasz o: najczęstszych błędach AI w pracy prawników, halucynacjach dotyczących przepisów, orzeczeń i sygnatur, konsekwencjach wykorzystania błędnych treści w piśmie procesowym, odpowiedzialności prawnika za poradę przygotowaną z pomocą AI, zasadach bezpiecznego wdrażania oprogramowania AI w kancelarii. Szersze omówienie zgodności, poufności, dostawców i klasyfikacji ryzyka znajdziesz w artykule AI dla prawników w Europie i Wielkiej Brytanii: kluczowe ryzyka i ograniczenia. Tutaj skupiamy się na tym, co może pójść źle w konkretnej sprawie prowadzonej na gruncie polskiego prawa i jak zaprojektować proces, który pomaga wykryć błąd przed wysłaniem porady lub pisma. Prawdziwa sygnatura, fałszywa teza: czego uczy postanowienie NSA I FZ 104/26 W postanowieniu z 23 czerwca 2026 r., I FZ 104/26, NSA rozpoznawał zażalenie na postanowienie odmawiające wstrzymania wykonania decyzji podatkowej. Skarżący powinien był uprawdopodobnić przesłanki określone w art. 61 § 3 p.p.s.a., w szczególności niebezpieczeństwo wyrządzenia znacznej szkody lub spowodowania trudnych do odwrócenia skutków. Pełnomocnik wskazał trzy orzeczenia wraz z rzekomymi tezami. Sąd ustalił, że wskazane orzeczenia dotyczyły innych zagadnień, a ich uzasadnienia nie zawierały przypisanych im tez. Nieprawidłowe były również daty wydania tych rozstrzygnięć. NSA zwrócił też uwagę na inny problem: pismo miało ogólnikowy charakter i nie zawierało konkretnych danych ani dokumentów, które pozwoliłyby ocenić sytuację majątkową strony. Zażalenie zostało oddalone. Sąd krytycznie ocenił bezrefleksyjne użycie AI przez zawodowego pełnomocnika i podkreślił, że klient ma prawo oczekiwać profesjonalizmu. Rozstrzygnięcie pokazuje trzy realne skutki wadliwego procesu pracy: argument prawny może stracić oparcie w źródle, w piśmie może zabraknąć faktów i dowodów decydujących dla rozstrzygnięcia, sąd może zakwestionować rzetelność pracy zawodowego pełnomocnika. Rzetelna weryfikacja orzeczenia obejmuje sprawdzenie sądu, daty, sygnatury i rodzaju rozstrzygnięcia, a następnie lekturę pełnej treści uzasadnienia. Prawnik powinien ocenić kontekst faktyczny, podstawę prawną, znaczenie przywołanego fragmentu, dostępne informacje o prawomocności oraz późniejsze orzecznictwo dotyczące tej samej kwestii. Siedem ograniczeń AI, które mogą zmienić wynik sprawy 1. Prawdziwemu źródłu można przypisać zmyśloną tezę Model może podać prawdziwą sygnaturę sprawy, artykuł ustawy albo tytuł publikacji, a następnie przypisać źródłu treść, której ono nie zawiera. Taki błąd jest groźniejszy od całkowicie zmyślonej sygnatury, ponieważ może pozostać niewykryty podczas pobieżnej kontroli. System powinien prowadzić użytkownika bezpośrednio do konkretnego fragmentu źródła. Nadal konieczna jest weryfikacja przez prawnika. Badanie Stanford RegLab dotyczące amerykańskich narzędzi prawniczych łączących wyszukiwanie w bazach z generowaniem odpowiedzi wykazało halucynacje w 17-33% odpowiedzi. Badanie obejmowało produkty i pytania z rynku USA, więc nie mierzy jakości polskich systemów. Podłączenie modelu do bazy prawnej ogranicza ryzyko. Dalsza kontrola poprawności wymaga dodatkowych zabezpieczeń. 2. Model może zastosować nieaktualny lub niewłaściwy przepis Odpowiedź może brzmieć sensownie i opierać się na przepisie, który został zmieniony, jeszcze nie obowiązuje albo dotyczy innej jurysdykcji. W sprawie transgranicznej model może pomylić prawo właściwe, właściwość sądu i zasady postępowania. System AI dla prawników powinien przy każdym wniosku wskazywać właściwy porządek prawny oraz datę, na którą ustalono stan prawny. Użytkownik musi widzieć wersję aktu, datę wejścia w życie zmiany i źródło urzędowe. Sam napis „aktualne” w interfejsie ma niewielką wartość bez informacji, kiedy i na podstawie czego aktualność została sprawdzona. 3. Model analizuje ograniczony zakres akt Akta mogą być niekompletne, załącznik może nie zostać poprawnie odczytany, a istotny fakt może znajdować się w tabeli, skanie lub wiadomości, której nie dodano do analizy. Model formułuje odpowiedź na podstawie otrzymanego materiału i nie ma pełnej wiedzy o dokumentach, których nie przekazano do analizy. W efekcie stanowczo brzmiąca odpowiedź może powstać na podstawie niepełnego obrazu sprawy. Przed analizą system powinien pokazać listę wykorzystanych plików, błędy odczytu i zakres pominiętego materiału. W sprawach wymagających ustalenia faktów przydatne jest osobne zestawienie twierdzeń, dowodów i brakujących materiałów. Dzięki temu prawnik może zauważyć, że wniosek powstał bez kluczowego dokumentu. 4. Obliczanie terminów procesowych wymaga zdefiniowanych reguł Obliczenie terminu zależy między innymi od rodzaju postępowania, sposobu doręczenia, daty zdarzenia, przepisów przejściowych, dni wolnych oraz wyjątków dotyczących konkretnej czynności. Model językowy może pominąć jeden z warunków albo błędnie odczytać datę ze skanu. Do obliczania terminów należy wykorzystywać kontrolowany mechanizm regułowy z jawnymi danymi wejściowymi. Model może odczytać daty z dokumentów i zasugerować ich znaczenie. Ostateczne wyliczenie wymaga wskazania podstawy prawnej, pokazania sposobu obliczenia oraz zatwierdzenia wyniku przez prawnika prowadzącego sprawę. Terminy, których uchybienie może wywołać skutki procesowe, wymagają niezależnego obliczenia i ponownej weryfikacji. 5. Twierdzenia faktyczne w piśmie przygotowanym z pomocą AI wymagają właściwych dowodów Według prasowych omówień wyroku Sądu Okręgowego we Wrocławiu z 27 listopada 2025 r., X GC 455/25, powód posłużył się ChatGPT przy przygotowaniu pozwu. Podstawą oddalenia powództwa było niespełnienie warunków formalnych zapytania ofertowego. Sąd odniósł się również do treści przygotowanych przy użyciu AI i do wartości przedstawionych materiałów. Wydruki obejmujące wygenerowaną argumentację, analizę prawną i ocenę szans powodzenia nie stanowiły dowodu na fakty istotne dla rozstrzygnięcia sprawy. Mogły zostać potraktowane jako element argumentacji strony. System dla prawników powinien wyraźnie oddzielać twierdzenia, podstawy prawne i materiał dowodowy. Brakująca umowa, korespondencja, potwierdzenie doręczenia lub dokument finansowy pozostają luką dowodową niezależnie od jakości wygenerowanego uzasadnienia. 6. Model może utwierdzać klienta w jego ocenie sprawy Klient często opisuje sprawę jednostronnie i oczekuje potwierdzenia swojej oceny. Model może przyjąć założenia klienta i pominąć argumenty drugiej strony. W poradzie prawnej powstaje wtedy ryzyko, że klient podejmie decyzję bez poznania słabych punktów sprawy. Analiza powinna uwzględniać perspektywę drugiej strony: brakujące fakty, możliwe zarzuty drugiej strony, przeszkody procesowe, alternatywne kwalifikacje prawne i poziom pewności. W komunikacji kierowanej bezpośrednio do klienta użytkownik powinien mieć możliwość przekazania pytania prawnikowi, szczególnie gdy pytanie dotyczy terminu, roszczenia, odpowiedzialności karnej, zwolnienia pracownika albo istotnej decyzji finansowej. 7. Przekonujący styl może ukrywać błędy i niepewność Model generuje odpowiedź słowo po słowie i może zachować ten sam profesjonalny ton przy wniosku trafnym oraz błędnym. Ocena użytkownika oparta na stylu jest więc zawodna. Wskaźnik pewności wyrażony w procentach również może tworzyć pozór precyzji, jeśli wynik nie został skalibrowany dla danego zastosowania. Dobrze zaprojektowany system wskazuje źródła, braki danych, warunki zmieniające odpowiedź i sytuacje, w których system powstrzymuje się od sformułowania jednoznacznej odpowiedzi. System powinien również przewidywać odmowę udzielenia odpowiedzi oraz przekazanie sprawy prawnikowi. Czy klient może twierdzić, że przegrał przez AI? Klient może podnieść taki zarzut. Ocena odpowiedzialności zależy jednak od sposobu wykonania usługi i okoliczności konkretnej sprawy. W relacji umownej zastosowanie znajdują przede wszystkim zasady określone w Kodeksie cywilnym. Zgodnie z art. 355 § 2 k.c. przy ocenie należytej staranności uwzględnia się zawodowy charakter działalności dłużnika. Art. 471 k.c. określa natomiast zasady odpowiedzialności za niewykonanie lub nienależyte wykonanie zobowiązania. Niekorzystne rozstrzygnięcie nie przesądza o nienależytym wykonaniu umowy o świadczenie pomocy prawnej. Ocenie podlega dochowanie należytej staranności zawodowej, prawidłowość ustalenia stanu faktycznego i prawnego oraz adekwatność podjętych czynności. W sporze dotyczącym odpowiedzialności kontraktowej klient powinien wykazać: istnienie i treść zobowiązania, niewykonanie albo nienależyte wykonanie zobowiązania, powstanie szkody, adekwatny związek przyczynowy między uchybieniem a szkodą. Art. 471 k.c. przewiduje domniemanie, że niewykonanie lub nienależyte wykonanie zobowiązania wynika z okoliczności, za które odpowiada dłużnik. Możliwość uwolnienia się od odpowiedzialności wymaga oceny okoliczności konkretnej sprawy. Na ocenę odpowiedzialności może wpływać sposób wykorzystania AI, w szczególności weryfikacja źródeł, uwzględnienie kompletu akt, zastosowanie aktualnego prawa oraz zachowanie kontroli nad ostateczną treścią porady. Znaczenie awarii lub błędu po stronie dostawcy będzie oceniane łącznie z wyborem narzędzia, warunkami umowy, zakresem przeprowadzonych testów oraz sposobem weryfikacji wyników przez prawnika. Przykładowe sytuacje obejmują: uchybienie terminowi wskutek błędnego ustalenia daty doręczenia, odradzenie środka prawnego na podstawie nieaktualnego przepisu, złożenie pisma z cytatem, który nie występuje w powołanym orzeczeniu, zalecenie zawarcia ugody oparte na niepełnych aktach lub błędnym obliczeniu skutków finansowych, udzielenie klientowi stanowczej odpowiedzi przez chatbot bez przekazania sprawy prawnikowi. Opisane sytuacje mają charakter przykładowy. Ocena odpowiedzialności wymaga każdorazowo ustalenia zakresu zlecenia, standardu należytej staranności, szkody oraz związku przyczynowego. Odrębnie mogą zostać ocenione przesłanki odpowiedzialności dyscyplinarnej. Prawo o adwokaturze i ustawa o radcach prawnych przewidują również obowiązek posiadania ubezpieczenia odpowiedzialności cywilnej. Obowiązkowe ubezpieczenie OC nie przesądza o objęciu ochroną każdej szkody związanej z użyciem AI. Zakres odpowiedzialności ubezpieczyciela zależy od warunków ubezpieczenia oraz okoliczności konkretnego zdarzenia. Jakie skutki procesowe może wywołać błędne pismo przygotowane przy użyciu AI? Skutki zależą od rodzaju uchybienia oraz przepisów właściwej procedury. Błąd wynikający z użycia AI jest oceniany tak samo jak każdy inny błąd w piśmie procesowym. Znaczenie ma jego wpływ na spełnienie wymogów formalnych, wykazanie faktów, uzasadnienie żądania oraz dochowanie terminu. W zależności od rodzaju uchybienia konsekwencją może być w szczególności: zwrot pisma, jeżeli nie uzupełniono jego braków formalnych, odrzucenie pozwu lub środka zaskarżenia, gdy zachodzą przesłanki określone we właściwej procedurze, pominięcie wniosku dowodowego albo dowodu, uznanie istotnego faktu za niewykazany, nieuwzględnienie argumentacji opartej na źródle, które nie potwierdza przywołanej tezy, oddalenie wniosku, środka zaskarżenia lub powództwa z powodu niewykazania wymaganych przesłanek, obciążenie strony kosztami postępowania lub zastosowanie sankcji procesowej, jeżeli przewidują ją właściwe przepisy. W sprawie I FZ 104/26 NSA oddalił zażalenie, ponieważ skarżący nie uprawdopodobnił przesłanek wstrzymania wykonania decyzji określonych w art. 61 § 3 p.p.s.a. Ogólnikowa argumentacja i brak dokumentów miały znaczenie dla tej oceny. Błędne odwołania do orzecznictwa były dodatkowym elementem krytycznej oceny sposobu sporządzenia pisma. Ewentualna odpowiedzialność odszkodowawcza pełnomocnika jest rozpatrywana w odrębnym postępowaniu. Odpowiedzialność dyscyplinarna podlega ocenie właściwych organów samorządu zawodowego. Co w 2026 roku wynika z zasad zawodowych i AI Act? 15 czerwca 2026 r. Naczelna Rada Adwokacka poinformowała o podjęciu uchwały zmieniającej Zbiór Zasad Etyki Adwokackiej i Godności Zawodu poprzez dodanie § 23e. Zgodnie z informacją NRA, narzędzia technologiczne powinny pełnić funkcję pomocniczą. Korzystanie z takich narzędzi musi respektować tajemnicę zawodową, samodzielność adwokata i jego osobistą rolę w prowadzeniu sprawy. Rezultat działania narzędzia wymaga własnej oceny i weryfikacji przez adwokata. W odniesieniu do radców prawnych punktem odniesienia są między innymi rekomendacje Krajowej Izby Radców Prawnych dotyczące korzystania z AI. Mają one charakter praktycznych wytycznych i obejmują między innymi odpowiedzialność zawodową, poufność, weryfikację wyników oraz nadzór człowieka. Na poziomie europejskim od 2 lutego 2025 r. stosuje się art. 4 AI Act. Przepis zobowiązuje dostawców i podmioty stosujące systemy AI do podejmowania działań wspierających rozwój kompetencji personelu w zakresie AI. Dobór tych działań powinien uwzględniać wiedzę techniczną, doświadczenie, wykształcenie i szkolenie personelu, a także kontekst, w którym system jest wykorzystywany, oraz osoby, wobec których ma być stosowany. Komisja Europejska wyjaśnia, że sposób wykonania tego obowiązku zależy od roli organizacji i ryzyka związanego z konkretnym zastosowaniem AI. Od 2 sierpnia 2026 r. właściwe organy sprawują nadzór nad wykonywaniem tego obowiązku. Klasyfikacja systemu AI zależy od jego zamierzonego zastosowania. Do systemów wysokiego ryzyka mogą należeć rozwiązania przeznaczone do stosowania przez organ wymiaru sprawiedliwości lub w jego imieniu w celu wspierania tego organu w badaniu i interpretacji faktów i prawa oraz stosowaniu prawa do konkretnego stanu faktycznego. Ocena obejmuje rzeczywistą funkcję systemu, jego przeznaczenie określone przez dostawcę oraz sposób wykorzystania przez podmiot stosujący. Narzędzia kancelaryjne służące do wyszukiwania dokumentów, redagowania tekstu lub przygotowywania streszczeń wymagają indywidualnej klasyfikacji. Samo wykorzystanie systemu w kancelarii lub dziale prawnym nie przesądza o zaliczeniu go do kategorii wysokiego ryzyka. Po zmianach przyjętych w 2026 r. obowiązki dotyczące systemów wymienionych w załączniku III mają być stosowane od 2 grudnia 2027 r. W zależności od funkcji systemu, rodzaju danych i sposobu jego wykorzystania zastosowanie mogą mieć również RODO, przepisy chroniące tajemnicę zawodową, przepisy właściwej procedury oraz zasady odpowiedzialności cywilnej i dyscyplinarnej. Jak projektować system AI dla prawników, aby ograniczać ryzyko? Dobre wdrożenie powinno ułatwiać wykrywanie pomyłek, ograniczać ich wpływ na prowadzoną sprawę i dokumentować wykonanie wymaganej kontroli. Ryzyko Kontrola w produkcie lub procesie Dokumentacja kontroli Fałszywa teza lub cytat Link do pełnej treści źródła i konkretnego fragmentu, podgląd kontekstu oraz obowiązek zatwierdzenia przed eksportem Sąd, data, sygnatura, rodzaj orzeczenia, źródło, wersja dokumentu i osoba zatwierdzająca Nieaktualny stan prawny Metadane jurysdykcji i daty, wersjonowanie aktów oraz sygnalizacja zmian Data, na którą ustalono stan prawny, i wykorzystana wersja przepisu Niekompletne akta Lista przeanalizowanych plików, komunikaty o błędach OCR i wykaz brakujących danych Wykaz dokumentów oraz raport z ich odczytu Błędne obliczenie terminu Mechanizm oparty na zdefiniowanych regułach, jawne dane wejściowe i ponowna kontrola przez człowieka Podstawa prawna, dane wejściowe, przebieg obliczenia i osoba zatwierdzająca Zbyt kategoryczna porada Pytania o brakujące fakty, warunki przekazania sprawy prawnikowi i możliwość odmowy udzielenia odpowiedzi Powód przekazania sprawy i podjęte dalsze działania Ujawnienie informacji objętych tajemnicą zawodową Uprawnienia na poziomie sprawy, kontrola dostępu dostawcy i jego podwykonawców, określone miejsce przetwarzania, zasady retencji i usuwania danych oraz wyłączenie wykorzystywania danych klienta do trenowania modeli Rejestr dostępu, konfiguracja dostawcy, okres przechowywania, informacje o podwykonawcach i dokumentacja incydentów Zmiana jakości po aktualizacji systemu Testy na reprezentatywnych sprawach przed wdrożeniem i po zmianie modelu Wyniki testów, wersja modelu i decyzja o dopuszczeniu nowej wersji Zakres dokumentowania powinien być proporcjonalny do ryzyka. Rejestry audytowe, w tym historia promptów i wyników, mogą zawierać informacje objęte tajemnicą zawodową. Organizacja powinna określić zakres zapisywanych danych, krąg osób uprawnionych do dostępu, okres przechowywania, zasady usuwania oraz sposób zabezpieczenia rejestrów. Pełna historia pracy z systemem nie musi być przechowywana, jeżeli do wykazania wykonanej kontroli wystarczy węższy zakres informacji. Do opisanego wcześniej przypadku pisma z błędnymi odwołaniami do orzecznictwa wraca Natalia Lener-Bobek, partner w Kancelarii Prawnej Sawaryn i Partnerzy. Zwraca uwagę na decyzje podejmowane jeszcze przed rozpoczęciem pracy z AI: wybór narzędzia i warunki umowy z jego dostawcą. „Ten przykład pokazuje błąd użytkownika. Ryzyko powstaje już wcześniej, przy wyborze samego narzędzia. Kancelarie sprawdzają, czy model dobrze odpowiada, i pomijają umowę, na podstawie której z niego korzystają. Rejestr promptów i wyników, o którym mowa w artykule, istnieje tylko wtedy, gdy dostawca zobowiązał się go prowadzić i udostępniać na żądanie – to zapis w umowie, nie funkcja, którą się zakłada. Przed wdrożeniem sprawdzam z klientami trzy rzeczy: czy umowa wskazuje, kto odpowiada za błędny wynik systemu, czy dostawca gwarantuje dostęp do logów zapytań przez okres wystarczający na obronę w ewentualnym sporze, i czy dane objęte tajemnicą zawodową w ogóle mogą trafiać do tego narzędzia zgodnie z warunkami przetwarzania. Bez odpowiedzi na te trzy pytania obowiązek szkolenia personelu z art. 4 AI Act i tak nie ma na czym się oprzeć” Natalia Lener-Bobek Partner w Kancelarii Prawnej Sawaryn i Partnerzy Bezpieczny podział pracy między systemem a prawnikiem Przydział zadań warto uzależnić od możliwej szkody oraz łatwości wykrycia błędu. Zadanie Rola AI Wymagana kontrola Streszczenie długiego dokumentu Przygotowanie roboczego skrótu z odwołaniami do stron Kontrola fragmentów istotnych dla decyzji Porównanie wersji umowy Wykrycie i uporządkowanie zmian Ocena znaczenia prawnego przez prawnika Wyszukiwanie i analiza orzecznictwa Wyszukanie potencjalnie istotnych orzeczeń i zebranie odpowiednich fragmentów Lektura pełnej treści orzeczenia oraz ocena jego kontekstu faktycznego i prawnego Pismo procesowe Przygotowanie projektu struktury, redakcja i kontrola spójności Pełna weryfikacja faktów, dowodów, żądań, podstaw prawnych i załączników Termin procesowy Odczytanie dat i wskazanie potencjalnie właściwych reguł obliczania terminu Ustalenie zdarzenia rozpoczynającego bieg terminu, podstawy prawnej, sposobu obliczenia i skutków uchybienia terminowi Termin materialnoprawny Uporządkowanie dat i wskazanie przepisów wymagających analizy Ustalenie charakteru terminu, początku i końca jego biegu oraz skutków upływu Przedawnienie Uporządkowanie zdarzeń mogących wpływać na bieg przedawnienia Ocena początku biegu, jego zawieszenia lub przerwania oraz daty upływu terminu przedawnienia Ostateczna porada dla klienta Przygotowanie materiałów roboczych i wariantów analizy Osobista ocena, zatwierdzenie i komunikacja prawnika Takie podejście jest zgodne z praktycznym kierunkiem wskazanym przez CCBE w przewodniku dla prawników: prawnik pozostaje odpowiedzialny za swoją pracę, poradę i oświadczenia, a wynik działania generatywnej AI wymaga kontroli przed wykorzystaniem. Bezpieczne wdrożenie AI w kancelarii zaczyna się od analizy procesu Pierwszym krokiem jest wskazanie, gdzie wynik wygenerowany przez AI może wpłynąć na poradę dla klienta, pismo procesowe, ocenę dokumentu lub obliczenie terminu. Na tej podstawie można określić właściwe źródła danych, zakres uprawnień, zasady weryfikacji oraz osoby odpowiedzialne za zatwierdzanie wyników. Jeżeli planujesz wykorzystać AI do analizy akt, pracy z dokumentami lub przygotowywania umów, poznaj rozwiązanie AI4Legal. Pomagamy kancelariom i działom prawnym zaprojektować narzędzia dopasowane do ich sposobu pracy, wymagań bezpieczeństwa i zakresu odpowiedzialności prawników. Źródła Naczelny Sąd Administracyjny, postanowienie z 23 czerwca 2026 r., I FZ 104/26. Prawo o postępowaniu przed sądami administracyjnymi, tekst jednolity, Dz.U. z 2026 r. poz. 143. Kodeks cywilny, tekst jednolity. Ustawa Prawo o adwokaturze, tekst jednolity. Ustawa o radcach prawnych, tekst jednolity. Naczelna Rada Adwokacka, zmiany zasad etyki dotyczące AI, 15 czerwca 2026 r.. Krajowa Izba Radców Prawnych, rekomendacje dotyczące korzystania z AI. CCBE, Guide on the use of generative AI for lawyers, 2 października 2025 r.. Komisja Europejska, ramy regulacyjne AI Act oraz wyjaśnienia dotyczące AI literacy. Rozporządzenie (UE) 2026/1744 zmieniające harmonogram stosowania części AI Act. Stanford RegLab, Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. Dziennik Gazeta Prawna, omówienie wyroku SO we Wrocławiu X GC 455/25, 7 stycznia 2026 r.. Dziennik Gazeta Prawna, wywiad dotyczący podstaw oddalenia powództwa w sprawie X GC 455/25. Stan prawny i źródłowy: 1 września 2026 r. Materiał ma charakter informacyjny i nie stanowi porady prawnej. FAQ: ograniczenia AI w oprogramowaniu prawniczym Czy klient może żądać odszkodowania, jeśli błędna porada powstała z użyciem AI? Takie roszczenie jest możliwe. Odpowiedzialność zależy od sposobu wykonania usługi, powstałej szkody i związku przyczynowego. Kluczowe są nienależyte wykonanie usługi, szkoda i związek przyczynowy. Ocenie podlega też zawodowa należyta staranność, w tym sposób weryfikacji wyniku narzędzia. Czy sąd odrzuci pismo tylko dlatego, że przygotowano je z AI? Nie ma ogólnej polskiej zasady nakazującej odrzucenie pisma z tego powodu. Sąd ocenia wymagania formalne, terminowość, argumenty i dowody według właściwej procedury. Błędne cytaty, brak dowodów lub wadliwe żądanie mogą jednak wywołać zwykłe skutki procesowe. Czy AI może samodzielnie pilnować terminów procesowych? Dla terminów krytycznych AI powinno działać jako element szerszego procesu obejmującego kontrolowane reguły i zatwierdzenie człowieka. Bezpieczniejszy proces wykorzystuje kontrolowane reguły, jawne daty wejściowe, podstawę prawną, zatwierdzenie człowieka i niezależne przypomnienie. Jak sprawdzić, czy orzeczenie rzeczywiście wspiera tezę wygenerowaną przez AI? Trzeba otworzyć pełną treść w urzędowej lub wiarygodnej bazie, odnaleźć wskazany fragment, przeczytać jego kontekst i sprawdzić datę, skład, rodzaj rozstrzygnięcia oraz stan prawny. Sama zgodność sygnatury i nazwy sądu nie potwierdza tezy. Czy trzeba zachowywać wszystkie prompty i odpowiedzi AI w aktach sprawy? Nie istnieje jeden ogólny obowiązek przechowywania pełnej historii każdej interakcji. Zakres dokumentowania powinien wynikać z ryzyka, zasad kancelarii, tajemnicy zawodowej, ochrony danych i potrzeb audytowych. W sprawach o większym znaczeniu warto zachować źródła, wersję systemu, zakres kontroli i informację o osobie zatwierdzającej.
Czytaj