Testowanie systemów AI to sprawdzenie, czy Wasz chatbot, asystent albo model działa poprawnie, bezpiecznie i zgodnie z prawem, zanim zrobi to za Was klient, dziennikarz albo organ nadzoru. Testujemy chatboty pod obowiązki przejrzystości z art. 50 AI Act, aplikacje oparte na modelach językowych pod kątem halucynacji, stronniczości, prompt injection i wycieku danych, a systemom wysokiego ryzyka przygotowujemy plan testów i dokumentację, której wymaga rozporządzenie.
Robimy to jako firma, która zajmuje się wyłącznie testowaniem i jakością oprogramowania. Nie piszemy opinii prawnych i nie sprzedajemy platformy AI. Dostajecie to, czego zwykle brakuje między kancelarią a zespołem wdrożeniowym: przepis przełożony na przypadki testowe, wykonane testy i raport, który da się pokazać audytorowi.
2.08.2026
od tego dnia obowiązuje art. 50 AI Act: chatbot musi powiedzieć, że jest AI
28.10.2026
KRiBSI może kontrolować i nakładać kary na podstawie polskiej ustawy
2.12.2027
wymogi dla systemów wysokiego ryzyka z załącznika III
450 000+
testów automatycznych napisanych przez zespół Quality Island
Co obejmuje testowanie systemów AI w Quality Island?
Testowanie systemów AI w naszym wydaniu ma cztery części. Każdą można zamówić osobno, ale najczęściej zaczyna się od pierwszej albo drugiej, bo tam terminy są najbliżej, a ryzyko najbardziej widoczne dla klientów.
1. Testy chatbotów pod art. 50 AI Act
Informacja, że rozmówca to AI. Sprawdzamy, czy komunikat pojawia się na starcie rozmowy w każdym kanale: na stronie, w aplikacji mobilnej, w komunikatorze i w wersji językowej, o której wszyscy zapomnieli
Oznaczanie treści generowanych. Weryfikujemy, czy teksty, obrazy i nagrania wytworzone przez system są oznaczone, także po eksporcie, pobraniu i udostępnieniu dalej
Ścieżki brzegowe. Przekazanie rozmowy do konsultanta i z powrotem, sesja wznowiona po przerwie, czytnik ekranu, bardzo długa rozmowa. Tam najczęściej znika to, co działało w demo
Raport z dowodami. Każdy przypadek testowy ma wynik, zrzut i datę. Po poprawkach robimy regresję, żeby raport opisywał stan faktyczny, a nie życzenia
2. Testowanie LLM i testy penetracyjne aplikacji LLM
Halucynacje. Zbiór pytań wzorcowych z oczekiwanymi odpowiedziami i progami jakości. Sprawdzamy, czy asystent odpowiada na podstawie Waszych dokumentów, czy dopowiada rzeczy, których w nich nie ma
Stronniczość (bias). Te same pytania w wariantach różniących się płcią, wiekiem, miejscem zamieszkania czy językiem. Różnice w odpowiedziach mierzymy, zamiast oceniać je na oko
Regresja odpowiedzi po zmianie modelu. Dostawca podmienia wersję modelu, a Wasz asystent nagle odpowiada inaczej. Zestaw testów regresji uruchamiany w pipeline wyłapuje to przed klientem, a nie po jego reklamacji
Testy po polsku. Odmiana, literówki, język urzędowy i bankowy. Tłumaczony z angielskiego zestaw testów przepuszcza właśnie te błędy, które zobaczy polski użytkownik
3. Plan testów i dokumentacja dla systemów wysokiego ryzyka
Art. 9, zarządzanie ryzykiem. Testy względem wcześniej zdefiniowanych metryk i progów, zanim system trafi na rynek
Art. 10, dane. Przegląd zbiorów treningowych, walidacyjnych i testowych pod kątem jakości i możliwych uprzedzeń
Art. 15, dokładność, odporność i cyberbezpieczeństwo. Metryki dokładności, testy odporności na błędy i próby manipulacji, wyniki gotowe do wpisania w instrukcję
Art. 17, system zarządzania jakością. Procedury badania, testowania i walidacji przed wdrożeniem, w trakcie i po nim, opisane tak, żeby dało się je powtórzyć przy każdej wersji
4. Szkolenia dla zespołów
Dlaczego zgodność z AI Act to kwestia testowania?
Bo rozporządzenie w wielu miejscach mówi językiem QA, a testowanie systemów AI staje się częścią zgodności, a nie dodatkiem do niej. AI Act (rozporządzenie 2024/1689) wymaga, żeby systemy wysokiego ryzyka były testowane względem metryk i progów, żeby deklarowały poziom dokładności i żeby miały procedury testowania i walidacji w systemie zarządzania jakością. Tego nie da się załatwić polityką w PDF. Potrzebne są przypadki testowe, wyniki i historia wersji.
Druga rzecz to terminy. Pakiet Digital Omnibus, czyli rozporządzenie 2026/1744, przesunął obowiązki dla systemów wysokiego ryzyka (oś czasu po zmianach). Jeżeli ktoś wciąż mówi Wam o sierpniu 2026, korzysta z nieaktualnych materiałów. Art. 50 jednak nie został przesunięty i obowiązuje już dziś.
Do tego dochodzi polski porządek. Ustawa o systemach sztucznej inteligencji (Dz.U. 2026 poz. 1003) obowiązuje od 11 sierpnia 2026 roku i powołuje Komisję Rozwoju i Bezpieczeństwa Sztucznej Inteligencji, w skrócie KRiBSI. Od 28 października 2026 roku Komisja może prowadzić kontrole i nakładać kary, a w jej składzie są przedstawiciele między innymi KNF i UOKiK (szczegóły na stronie Ministerstwa Cyfryzacji).
| Termin |
Co zaczyna obowiązywać |
Kogo dotyczy |
Co testujemy |
| 2.08.2026 |
Art. 50: informacja o interakcji z AI, oznaczanie treści syntetycznych |
Każdy, kto udostępnia chatbota albo generuje treści |
Komunikaty we wszystkich kanałach, oznaczenia treści |
| 11.08.2026 |
Polska ustawa o systemach AI w zasadniczej części |
Dostawcy i podmioty stosujące AI w Polsce |
Inwentaryzacja systemów i dowody testów |
| 28.10.2026 |
Kontrole i kary KRiBSI, opinie indywidualne |
Firmy objęte nadzorem w Polsce |
Raporty z testów gotowe do okazania |
| 2.12.2026 |
Art. 50 ust. 2, znakowanie treści w systemach sprzed 2.08.2026 |
Systemy działające już przed sierpniem 2026 |
Znakowanie treści po eksporcie i udostępnieniu |
| 2.12.2027 |
Wysokie ryzyko z załącznika III |
Scoring kredytowy, HR i rekrutacja, edukacja, infrastruktura krytyczna |
Plan testów pod art. 9, 10, 15 i 17 |
| 2.08.2028 |
Wysokie ryzyko z załącznika I |
AI w produktach, np. w wyrobach medycznych |
Testy AI razem z wymaganiami produktowymi |
Więcej o obowiązkach dla systemów wysokiego ryzyka piszemy w artykule AI Act: obowiązki testowania systemów wysokiego ryzyka, a szerszy obraz przepisów, które wymagają testów, znajdziecie na stronie zgodność regulacyjna.
Czy testowanie systemów AI dotyczy Waszej firmy?
Macie na stronie albo w aplikacji chatbota obsługi klienta i nikt nie sprawdził, czy w każdym kanale mówi, że jest AI?
Wasz asystent odpowiada na podstawie dokumentów firmy, a Wy nie wiecie, jak często coś zmyśla?
Dostawca modelu zapowiedział nową wersję, a Wy nie macie testów, które pokażą, co się zmieniło w odpowiedziach?
Budujecie scoring kredytowy, narzędzie do selekcji CV albo system dla szkoły i ktoś w końcu zapytał o 2 grudnia 2027?
Dział prawny przygotował analizę AI Act i teraz szuka kogoś, kto przełoży ją na testy?
Zespół QA dostał do przetestowania system niedeterministyczny i sam przyznaje, że nie wie, od czego zacząć?
Jeśli choć jedno pytanie brzmi znajomo, testowanie systemów AI jest dla Was tematem na teraz, a nie na 2027 rok. W 2025 roku AI używało 42 procent dużych firm w Polsce (dane GUS), więc jesteście w dobrym, choć zapracowanym towarzystwie.
Dlaczego warto testować AI z Quality Island?
Zajmujemy się tylko testowaniem i jakością. Ponad 152 zrealizowane projekty i ponad 450 000 napisanych testów automatycznych. Testowanie systemów AI robimy tym samym warsztatem, a nie jako nowy pomysł na biznes
Jesteśmy niezależni od producenta. Nie budujemy Waszego chatbota i nie sprzedajemy modelu, więc nie oceniamy własnej pracy. W sektorach regulowanych to często warunek, a nie miły dodatek
Znamy sektor regulowany od środka. Dla PKO BP opracowaliśmy i wdrożyliśmy strategię jakości oprogramowania dla całej organizacji, a dla ChaosGears z branży medycznej zbudowaliśmy dokumentację testową i odbiorczą
Uczymy tego, co robimy. Zespół jest certyfikowany ISTQB, a ankiety po naszych szkoleniach (ponad 350 wypełnionych) dają 5 na 5 za poziom merytoryczny
Testowanie systemów AI prowadzimy w sześciu krokach. Pierwsze wyniki widzicie już przy wykonaniu testów, a nie dopiero w raporcie końcowym.
01
Rozmowa i inwentaryzacja
Bezpłatna rozmowa. Ustalamy, jakie systemy AI macie, w jakiej roli jesteście według AI Act i który termin dotyczy Was najpierw.
02
Mapa ryzyk i zakres
Dla każdego systemu wybieramy obszary: art. 50, jakość odpowiedzi, bezpieczeństwo, wymagania dla wysokiego ryzyka. Zakres i cenę znacie przed startem.
03
Projekt testów
Zbiory pytań wzorcowych, scenariusze ataków, progi jakości i kryteria zaliczenia. Uzgadniamy je z Wami, bo to Wy wiecie, która odpowiedź jest poprawna.
04
Wykonanie testów
Testy ręczne tam, gdzie liczy się ocena człowieka, automatyczne tam, gdzie trzeba powtarzać je setki razy. Każdy wynik z dowodem.
05
Raport i poprawki
Raport z priorytetami i rekomendacjami, a po poprawkach regresja. Dokumentacja w formie, którą pokażecie audytorowi albo KRiBSI.
06
Regresja i szkolenie
Zestaw testów regresji w pipeline na każdą zmianę modelu albo promptu oraz szkolenie, po którym Wasz zespół prowadzi to dalej sam.
Dobrze zaplanowane testowanie systemów AI daje pięć rzeczy, które da się pokazać zarządowi, audytorowi i klientom.
Dowód, a nie deklarację. Raport z wykonanych testów zamiast zapewnienia dostawcy, że wszystko jest zgodne
Chatbota, który nie zaskoczy klienta zmyśloną odpowiedzią, cudzymi danymi albo brakiem informacji, że jest AI
Spokojną aktualizację modelu, bo testy regresji pokażą różnice w odpowiedziach, zanim zobaczą je użytkownicy
Czas na wysokie ryzyko. Plan testów pod art. 9, 10, 15 i 17 przygotowany z zapasem, a nie w listopadzie 2027
Zespół, który rozumie testowanie systemów AI i nie potrzebuje nas przy każdej zmianie
Jakich rezultatów możecie się spodziewać?
Uczciwie: testowanie systemów AI nie zamienia się samo w zgodność z AI Act i nie obiecujemy, że po naszych testach system będzie zgodny. Zgodność ocenia prawnik i organ nadzoru, a my dostarczamy im materiał dowodowy. Nie obiecujemy też zera halucynacji, bo modele językowe tak nie działają. Obiecujemy, że będziecie wiedzieć, jak często i w jakich sytuacjach system się myli, i że będziecie to mierzyć przy każdej zmianie.
Po pierwszym przebiegu dostajecie listę błędów z priorytetami, zestaw testów do ponownego uruchamiania i dokumentację wykonanych testów. Ile błędów znajdziemy, zależy od systemu, więc nie podajemy liczby przed testami.
Ile kosztuje testowanie systemów AI?
| Usługa |
Co dostajecie |
Cena |
| Testy chatbota pod art. 50 AI Act |
Testy komunikatu o AI i oznaczania treści we wszystkich kanałach, raport z dowodami, regresja po poprawkach |
od 5 500 zł netto |
| Testy LLM, pakiet jednorazowy |
Halucynacje, bias, prompt injection, wycieki danych i regresja po zmianie modelu, raport z priorytetami |
od 24 000 zł netto |
| Regresja LLM w abonamencie |
Zestaw testów uruchamiany po każdej zmianie modelu albo promptu, raport z różnic; wdrożenie wyceniane według zakresu |
od 3 900 zł netto miesięcznie |
| Plan testów pod system AI wysokiego ryzyka |
Plan testów i dokumentacja pod art. 9, 15 i 17 AI Act, bez opinii prawnej |
od 12 000 zł netto |
| Szkolenie zespołu |
Szkolenie zamknięte dla Waszego zespołu na bazie naszych szkoleń z testowania AI |
według cennika szkolenia |
Ostateczna cena za testowanie systemów AI zależy od liczby systemów, kanałów i scenariuszy, dlatego po rozmowie dostajecie stałą wycenę na piśmie. Część szkoleniowa może kwalifikować się do dofinansowania. Jeśli tak jest, obsługę całego procesu bierzemy na siebie bez dodatkowej opłaty, szczegóły na stronie dofinansowania i rabaty.
Opowiedzcie nam o swoim chatbocie albo modelu. W pierwszej rozmowie ustalimy, który termin AI Act dotyczy Was najpierw i od czego zacząć testy.
Porozmawiajmy
Najczęściej zadawane pytania o testowanie systemów AI
Czy nasz chatbot podlega art. 50 AI Act?
Jeżeli osoba rozmawia z nim bezpośrednio, najpewniej tak: od 2 sierpnia 2026 roku musi wiedzieć, że wchodzi w interakcję z systemem AI, chyba że jest to oczywiste z kontekstu. Treści syntetyczne trzeba oznaczać, a dla systemów działających przed 2 sierpnia 2026 roku znakowanie obowiązuje od 2 grudnia 2026 roku. Ostateczną kwalifikację potwierdza Wasz dział prawny, my sprawdzamy, czy obowiązek działa w praktyce.
Czym testowanie LLM różni się od zwykłych testów?
Model językowy na to samo pytanie potrafi odpowiedzieć na kilka sposobów, więc nie porównujemy wyniku z jednym oczekiwanym tekstem. Definiujemy kryteria poprawności, uruchamiamy te same scenariusze wielokrotnie i mierzymy odsetek odpowiedzi, które je spełniają. Do tego dochodzą testy bezpieczeństwa, których w klasycznej aplikacji nie było, na przykład prompt injection. Dlatego testowanie systemów AI to osobna dyscyplina, a nie zwykła lista kontrolna.
Czy robicie testy penetracyjne aplikacji LLM?
Tak, w zakresie ryzyk z listy OWASP Top 10 for LLM Applications: prompt injection, ujawnienie danych wrażliwych i promptu systemowego, nadmierne uprawnienia agentów i niebezpieczne przetwarzanie odpowiedzi modelu. Testy aplikacji wokół modelu, czyli API, logowania i infrastruktury, wykonujemy w ramach
testów bezpieczeństwa.
Nasz system nie jest wysokiego ryzyka. Czy testy mają sens?
Tak, bo testowanie systemów AI chroni nie tylko przed organem nadzoru. Chatbot, który zmyśla warunki promocji albo pokazuje cudze dane, jest problemem biznesowym niezależnie od kategorii w AI Act. Zakres testów dobieramy wtedy do ryzyka dla klientów i marki, a nie do listy artykułów.
Kiedy zacząć przygotowania do terminu 2 grudnia 2027?
Najlepiej teraz, bo testowanie systemów AI wysokiego ryzyka to nie jednorazowa akcja. Plan testów pod art. 9, 10, 15 i 17 wymaga metryk, danych testowych i procedur, które trzeba potem kilka razy uruchomić i poprawić. Normy zharmonizowane dla AI są jeszcze w przygotowaniu, więc wcześniejszy start daje czas na dopasowanie dokumentacji, gdy zostaną opublikowane.
Czy musimy przeszkolić zespół z AI, żeby uniknąć kary?
Art. 4 AI Act po zmianach z 2026 roku mówi o podejmowaniu działań wspierających kompetencje w zakresie AI, a nie o gwarantowaniu konkretnego poziomu wiedzy. Dlatego nie straszymy karą za brak szkolenia. Szkolenie jest po prostu najprostszym i udokumentowanym sposobem, żeby zespół testował AI świadomie.
Czy wystawiacie certyfikat zgodności z AI Act?
Nie. Nie jesteśmy jednostką notyfikowaną ani kancelarią. Testowanie systemów AI kończymy dokumentacją: dostarczamy plan testów, wyniki i dokumentację testową, na których opiera się ocena zgodności wykonywana przez Was, prawników albo jednostkę oceniającą.
Pierwsza rozmowa jest bezpłatna. Powiedzcie, co testujemy, a my powiemy, ile to potrwa.
Porozmawiajmy