Przygotowanie danych do czatu: jak zrobić to krok po kroku
Sprawdź, jak przygotować dokumenty do czatu ze sztuczną inteligencją: oczyść pliki, podziel tekst i zweryfikuj uprawnienia, by uzyskać trafne odpowiedzi.
Aby czat AI poprawnie korzystał z twoich dokumentów, najpierw zinwentaryzuj i oczyść źródła, przygotuj fragmenty tekstu (chunking) i zaindeksuj je. Jakość danych liczy się bardziej niż ich ilość, a cały proces jest iteracyjny: wymaga testów i kontroli uprawnień dostępu, zanim odpowiedzi czatu zaczną być wiarygodne.
Krótko mówiąc:
- Przy setkach dokumentów wybierz konektor respektujący uprawnienia organizacji; ręczne wgrywanie sprawdza się w pilotażu, ale wymaga odświeżania po zmianach treści.
- Czyszczenie może pochłonąć nawet 80% czasu projektu opartego na sztucznej inteligencji, dlatego warto usuwać duplikaty, ujednolicać format i dodawać metadane przed podziałem dokumentów na fragmenty.
- Przygotuj pytania kontrolne o znanych odpowiedziach i sprawdź cytowane źródła; po każdej aktualizacji powtórz testy, także pytania bez podstaw w dokumentach.
- Nie przesyłaj danych osobowych ani finansowych bez anonimizacji; sprawdź też ustawienia trenowania rozmów, bo zasady ChatGPT zależą od rodzaju konta.
Spis treści
- Metody połączenia danych z czatem: konektory, upload i agenci
- Checklist przygotowania danych: audyt, czyszczenie, chunking i indeksowanie
- Testowanie czatu i iteracja poprawek na własnych danych
- Prywatność i uprawnienia przed uruchomieniem czatu
- Case SzopaLabs: Skorowidz i Sygnatura w praktyce przygotowania danych
- Perspektywa autora: dlaczego jakość danych decyduje o sukcesie czatu
- Pilotaż z SzopaLabs: od przygotowanych danych do gotowego czatu
- Najczęściej zadawane pytania
- Źródła
Metody połączenia danych z czatem: konektory, upload i agenci
Wybór metody integracji zależy od skali danych i tego, jak szybko potrzebujesz pierwszych wyników. Konektory oparte na Microsoft Graph łączą czat z dokumentami w SharePoint, OneDrive czy Teams i respektują istniejące uprawnienia w organizacji, co opisuje dokumentacja Microsoft Copilot. To podejście sprawdza się przy większych zbiorach dokumentów firmowych, gdzie ręczne wgrywanie plików byłoby nieefektywne.
Upload plików to najszybszy sposób na pilotaż: wgrywasz kilka dokumentów prosto do czatu i widzisz efekt w kilka minut, bez konfiguracji infrastruktury. Ograniczenie jest proste: ten sposób nie skaluje się przy setkach dokumentów i wymaga ręcznego odświeżania przy każdej zmianie treści.
Custom GPT i agenci stają się sensowną inwestycją, gdy dane rosną i potrzebujesz semantycznego indeksu, który sam wyszukuje właściwe fragmenty. Granice dostępu różnią się znacząco między usługami:
- Copilot działa w ramach uprawnień tenanta i nie wykorzystuje danych klientów do trenowania modeli bazowych, co potwierdza dokumentacja prywatności Microsoft 365 Copilot.
- Copilot Chat może korzystać z wyszukiwania w internecie i oferuje mechanizmy ochrony danych w wersji dla organizacji, zgodnie z informacjami o prywatności Copilot Chat.
- ChatGPT pozwala kontrolować, czy rozmowy trafiają do procesu trenowania modeli, poprzez ustawienia opisane przez OpenAI.
Checklist przygotowania danych: audyt, czyszczenie, chunking i indeksowanie
Zanim jakikolwiek plik trafi do czatu, przejdź przez pięć etapów w ustalonej kolejności. Pominięcie jednego z nich zwykle kończy się odpowiedziami, które brzmią dobrze, ale odnoszą się do nieaktualnych albo niepełnych danych.
- Zinwentaryzuj źródła. Spisz, gdzie leżą dokumenty, kto jest ich właścicielem, w jakim formacie są zapisane i kto ma do nich dostęp.
- Wyczyść dane. Usuń duplikaty, popraw błędy w formatowaniu i ujednolić zapis dat, nazw i jednostek.
- Znormalizuj format. Przekonwertuj pliki do jednego standardu (na przykład PDF lub czysty tekst), żeby parser traktował je jednakowo.
- Pociąć dane na fragmenty. Dopasuj długość chunku do kontekstu: zbyt krótki fragment traci sens, zbyt długi rozmywa odpowiedź; dodaj metadane takie jak data, autor i źródło.
- Zaindeksuj i zaplanuj aktualizacje. Wybierz podejście do embeddingów, które odpowiada skali danych, i ustal harmonogram odświeżania w ramach prostego pipeline'u ETL.
Czyszczenie danych pochłania nawet do 80% czasu pracy analityka w projekcie opartym na AI, co pokazuje, że ten etap nigdy nie powinien być traktowany jako formalność. Zasada „garbage in, garbage out“ sprawdza się tu dosłownie: lepiej mieć sto dobrze oczyszczonych dokumentów niż tysiąc pełnych błędów.
Porada profesjonalisty: Zacznij od jednego katalogu dokumentów, przejdź przez cały checklist na małej próbce, a dopiero potem skaluj proces na resztę danych.
Testowanie czatu i iteracja poprawek na własnych danych
Po pierwszym wdrożeniu czat trzeba sprawdzić na realnych pytaniach, zanim ktokolwiek zacznie mu ufać na poważnie. Przygotuj zestaw pytań kontrolnych, których odpowiedzi znasz z wyprzedzeniem, i dodaj kilka pytań kontrfaktycznych, które sprawdzają, czy czat nie wymyśla odpowiedzi tam, gdzie danych brakuje.
- Sprawdzaj, czy czat poprawnie cytuje źródło i fragment, z którego wziął odpowiedź.
- Monitoruj częstość halucynacji, czyli odpowiedzi niepotwierdzonych w dokumentach.
- Wprowadzaj zmiany w małych krokach i po każdej powtarzaj zestaw testów regresyjnych.
- Zautomatyzuj powtarzanie testów przy każdej aktualizacji bazy dokumentów, żeby nie sprawdzać wszystkiego ręcznie.
Czyszczenie i testowanie danych to proces iteracyjny: błędy w strukturze danych wychodzą dopiero po pierwszych próbach, co opisuje praktyczny poradnik o czyszczeniu danych. Regularne powtarzanie testów po każdej aktualizacji bazy wiedzy jest jedynym sposobem, by utrzymać jakość odpowiedzi na stałym poziomie.
Prywatność i uprawnienia przed uruchomieniem czatu
Zamiast tworzyć nowe, luźne reguły dostępu, korzystaj z istniejących modeli uprawnień w organizacji, na przykład tych znanych z SharePoint czy Microsoft 365, które Copilot respektuje bez dodatkowej konfiguracji. Dokumenty z ograniczonym dostępem powinny zostać ograniczone na tym samym poziomie w czacie.
Przy dokumentach zawierających dane osobowe czy finansowe sprawdź wcześniej narzędzia do anonimizacji dokumentów przed przetwarzaniem przez AI, które usuwają dane wrażliwe zanim trafią do indeksu. Przed pełnym wdrożeniem przetestuj czat na koncie z ograniczonym dostępem i przejrzyj logi interakcji, żeby zobaczyć, do jakich dokumentów faktycznie sięga.

Case SzopaLabs: Skorowidz i Sygnatura w praktyce przygotowania danych
Biuro rachunkowe, które przechodzi przez opisany proces, może zacząć pilotaż od Skorowidza, prywatnego czatu działającego na własnych dokumentach biura. Typowy scenariusz wygląda tak:
- audyt dokumentów klienta i wybór pierwszego, ograniczonego zbioru do testu,
- integracja plików bez przesyłania danych do publicznych modeli AI,
- testy pilotażowe na pytaniach, które biuro zadaje najczęściej.
Równolegle Sygnatura dostarcza cotygodniowo odświeżany przegląd orzecznictwa podatkowego, który działa jako osobna warstwa wiedzy, niezależna od dokumentów wewnętrznych biura. Więcej o samym procesie wdrożenia opisujemy w przewodniku o AI w biurze rachunkowym.
Perspektywa autora: dlaczego jakość danych decyduje o sukcesie czatu
Większość nieudanych wdrożeń czatu nie wynika z wyboru złego modelu, lecz z pominięcia nudnego etapu czyszczenia danych. Zacznij od małego pilotażu, mierz konkretne wskaźniki i rozszerzaj zakres tylko wtedy, gdy dokumentacja i testy to potwierdzają.
— Michał
Pilotaż z SzopaLabs: od przygotowanych danych do gotowego czatu
Jeśli przeszedłeś już przez etapy audytu, czyszczenia i chunkingu, Skorowidz daje ci gotowy prywatny czat na dokumentach biura. Opłaty i warunki wdrożenia dostępne są na stronie produktu. Sygnatura uzupełnia to o cotygodniowy przegląd orzecznictwa, a Wywiad Gruntowy sprawdza się tam, gdzie potrzebujesz jednorazowej analizy dokumentów dotyczących konkretnej nieruchomości.

Nasze narzędzia działają po polsku, nie przetwarzają danych wrażliwych na publicznych modelach AI i pozwalają wypróbować funkcje przed zakupem.
- Plan Skorowidz kosztuje od 249 zł miesięcznie za biuro.
- Przykładowy raport Wywiad Gruntowy możesz zobaczyć na przykładzie z Krakowa.
- Cennik Sygnatury sprawdzisz na stronie produktu.
Umów pilotaż i zobacz, jak twoje własne dokumenty zaczynają pracować w codziennej obsłudze klientów.
Najczęściej zadawane pytania
Jak ustawić czat, aby korzystał z moich dokumentów?
Podłącz dokumenty przez konektor (na przykład Microsoft Graph) albo wgraj pliki bezpośrednio do czatu jako szybki pilotaż. Wcześniej dokumenty powinny przejść przez czyszczenie i podział na fragmenty, inaczej czat może odwoływać się do nieaktualnych lub błędnych treści.
Jakie są zasady korzystania z Copilot i ChatGPT przy pracy z danymi firmy?
Microsoft Copilot respektuje istniejące uprawnienia w organizacji i nie wykorzystuje danych klientów do trenowania modeli bazowych. ChatGPT pozwala kontrolować, czy rozmowy trafiają do treningu modeli, poprzez ustawienia opisane przez OpenAI.
Czego nie wpisywać do czatu AI?
Unikaj wpisywania danych osobowych, numerów kont czy dokumentów objętych tajemnicą zawodową bez wcześniejszej anonimizacji. Jeśli dokumenty muszą trafić do czatu, usuń lub zamaskuj dane wrażliwe przed przetwarzaniem, korzystając na przykład z narzędzi do anonimizacji dokumentów.
Czy ChatGPT przechowuje dane z rozmów?
OpenAI udostępnia ustawienia kontroli danych, które pozwalają wyłączyć użycie rozmów do trenowania modeli oraz zarządzać historią konwersacji, zgodnie z opisem zasad przetwarzania danych. Domyślne ustawienia różnią się między kontem indywidualnym a kontem biznesowym, dlatego warto sprawdzić konfigurację przed wgraniem dokumentów firmowych.
Ile czasu zajmuje przygotowanie danych do czatu?
Największą część pracy pochłania czyszczenie danych, które może zajmować nawet 80% czasu projektu opartego na AI. Czas zależy od liczby źródeł i ich stanu wyjściowego, ale pomijanie tego etapu prowadzi do gorszej jakości odpowiedzi czatu.
Źródła
- Vita
- Data, Privacy and Security for Microsoft Copilot
- How ChatGPT uses data (OpenAI Help Center)
- Microsoft Copilot Chat privacy and protections