Powrót do Monitor Imigracji

Metodologia i transparentność

Jak zbieramy dane i klasyfikujemy podmioty. Pełna przejrzystość źródeł, metod i założeń.

Wersja: v2.2
Ostatnia aktualizacja: 2026-05-27

1. Źródła danych

Monitor Imigracji łączy cztery niezależne źródła danych publicznych. Każde z nich opisano poniżej wraz z informacją o licencji oraz o tym, jakie dane z niego pozyskujemy.

KRS (Krajowy Rejestr Sądowy). Polski krajowy rejestr sądowy podmiotów gospodarczych, prowadzony przez Ministerstwo Sprawiedliwości. Dane pobieramy bezpośrednio z publicznego API rejestru, odczytując wpis każdego podmiotu po jego 10-cyfrowym numerze KRS. Z każdego wpisu pozyskujemy: nazwę podmiotu, numery NIP/REGON, formę prawną, datę rejestracji, adres, główne i dodatkowe kody PKD oraz imiona, nazwiska i funkcje członków zarządu, rady nadzorczej oraz prokurentów. Dane KRS są publiczne, możliwe do swobodnego ponownego wykorzystania i stanowią wiarygodne źródło dla każdej spółki z ograniczoną odpowiedzialnością, spółki akcyjnej, fundacji lub stowarzyszenia zarejestrowanego w Polsce.

CRBR (Centralny Rejestr Beneficjentów Rzeczywistych). Polski rejestr beneficjentów rzeczywistych, prowadzony przez Ministerstwo Finansów. Wysyłamy zapytania do CRBR po numerze NIP. CRBR dostarcza nam zadeklarowane obywatelstwo poszczególnych beneficjentów rzeczywistych (kody krajów ISO 3166-1 alpha-2), kraj zamieszkania oraz pełne imiona i nazwiska. Pokrycie jest częściowe: nie każdy podmiot KRS ma dane w CRBR, rejestr obejmuje wyłącznie podmioty mieszczące się w jego ustawowym zakresie, a część zapytań zwraca status „brak dostępnych informacji”. Gdy CRBR nie zwraca danych, opieramy się wyłącznie na polach z KRS.

CEIDG (Centralna Ewidencja i Informacja o Działalności Gospodarczej). Polski publiczny rejestr jednoosobowych działalności gospodarczych, obejmujący około 6 milionów obecnych i historycznych właścicieli. Z każdego wpisu pozyskujemy imię i nazwisko właściciela, datę rozpoczęcia działalności, adres (używany wyłącznie do ustalenia gminy), kod PKD, status działalności oraz — z pojedynczego zapytania szczegółowego do API CEIDG — zadeklarowane obywatelstwo, jeśli jest dostępne. Jednoosobowa działalność jest osobą fizyczną zarejestrowaną często pod adresem domowym, dlatego rekordów CEIDG nigdy nie geokodujemy i nie nanosimy jako punktów; klasyfikujemy je tą samą metodą obywatelstwo-plus-nazwisko co KRS (§3) i pokazujemy wyłącznie podzbiór sklasyfikowany jako niebiały, w formie agregatów na poziomie gmin (zob. §13). CEIDG jest jawne z mocy prawa.

Wewnętrzny słownik OSINT. Imię i nazwisko → pochodzenie. Jest to mapa imion i nazwisk do pochodzenia, która pozwala wychwycić beneficjentów rzeczywistych, których pochodzenie nie wynika bezpośrednio z danych zadeklarowanych w CRBR. Proces budowy słownika wyglądał następująco: wyodrębniliśmy każde unikalne pełne imię i nazwisko właściciela z KRS i CRBR (853 864 unikalne wpisy w całym zbiorze), a następnie uruchomiliśmy klasyfikator AI na całej tej puli, aby ocenić każde imię i nazwisko względem podgrup pochodzenia używanych w projekcie. Klasyfikator był iteracyjnie uruchamiany około dwudziestu razy; każda kolejna iteracja zaostrzała reguły, potwierdzała jednoznaczne przypadki, odrzucała dopasowania o niskiej pewności i kierowała przypadki graniczne do dalszej analizy, po czym następowała ręczna weryfikacja tych przypadków. Spośród około 854 000 ocenionych imion i nazwisk 2 418 trafiło ostatecznie do słownika jako przypadki niebiałej klasyfikacji wnioskowanej na podstawie nazwiska (arabskie, tureckie, wietnamskie, indyjskie, chińskie, pakistańskie, koreańskie, irańskie, afrykańskie, bangladeskie, afgańskie itd.); pozostałe odpadły jako polskie, białoeuropejskie albo niedopasowane. Zob. §3, aby sprawdzić, jak słownik łączy się z sygnałem obywatelstwa.

Geokodowanie. Adresy podmiotów, czyli te dostarczone przez KRS, są geokodowane, aby można było umieścić podmiot na mapie. Niepowodzenia są zapisywane, ale nie zatrzymują procesu importu; podmiot, którego nie udało się zgeokodować, jest zapisany bez współrzędnych i nie pojawia się w widoku mapy, ale pozostaje widoczny w tabeli.

Okno pokrycia danych. Aktualny zbiór danych odzwierciedla stan zebrany do wczesnej wiosny 2026 roku. Zob. §2, aby sprawdzić, co oznacza to dla końcowych fragmentów szeregów czasowych, zwłaszcza dla częściowego widoku roku 2026.

2. Zakres czasowy

Dwie kwestie dotyczące osi czasu są regularnie błędnie odczytywane; obie wyjaśniamy tutaj wprost.

Skrajnie lewa pozycja na suwaku czasu nie jest pojedynczym kwartałem — obejmuje wszystko sprzed 2012 roku. KRS działa od 2001 roku, a nasz zbiór danych obejmuje również podmioty zarejestrowane tak dawno temu. Zamiast rozciągać suwak na jedenaście lat wczesnych danych o niskim wolumenie, z podziałem na kwartały, grupujemy wszystkie rejestracje sprzed 2012 roku w skrajnie lewej pozycji. Od 2012-Q1 każda pozycja suwaka odpowiada jednemu kwartałowi i dodaje nowe rejestracje z tego kwartału do sumy narastającej. Gdy przesuwasz suwak do lewej krawędzi, widzisz więc skumulowaną liczbę wszystkich podmiotów KRS zarejestrowanych między 2001 rokiem a końcem 2011 roku; jeden krok w prawo dodaje 2012-Q1, kolejny dodaje 2012-Q2 i tak dalej.

Aktualne dane sięgają wczesnej wiosny 2026 roku. Ponieważ dane kończą się w trakcie kwartału, pozycja 2026-Q1 na suwaku jest celowo zaniżona, a suma dla roku kalendarzowego 2026 odzwierciedla wyłącznie wczesnowiosenny wycinek danych. Obie wartości będą wyglądały na mniejsze niż rzeczywiste liczby dla pełnego okresu albo niż prognozy wykraczające poza datę odcięcia. Wszystko oznaczone jako 2026 należy traktować jako dolną granicę dla tego okresu.

Co to oznacza dla każdego wykresu. Skrajnie lewa część szeregu czasowego to agregat lat 2001–2011, a nie pojedynczy kwartał, więc porównywanie jej wielkości z pojedynczym późniejszym kwartałem nie jest porównaniem jeden do jednego. Skrajnie prawa część to częściowy wycinek roku 2026, który pozostawiamy widoczny dla przejrzystości, ale nie wykorzystujemy go do głównych liczb.

3. Klasyfikacja: obywatelstwo i nazwisko łącznie

Każdemu podmiotowi przypisywana jest podgrupa pochodzenia (np. polskie, wietnamskie, tureckie) oraz grupa nadrzędna (np. białe, azjatyckie, MENA). Klasyfikator korzysta z dwóch sygnałów: obywatelstwa z CRBR oraz wzorca imienia i nazwiska ze słownika OSINT. Deterministyczna reguła decyduje, który z nich staje się podstawową klasyfikacją podmiotu.

Sygnał A (obywatelstwo z CRBR). Gdy CRBR zwraca co najmniej jednego beneficjenta rzeczywistego z obywatelstwem innym niż polskie, mapujemy kod kraju ISO na podgrupę pochodzenia przy użyciu wersjonowanego słownika wewnętrznego. Przykłady: UA → białe / ukraińskie; IN → Azja Południowa / indyjskie; TR → MENA / tureckie; NG → czarne / afrykańskie. Polskie obywatelstwo jest traktowane jako wartość bazowa i samo w sobie nie uruchamia klasyfikacji niebiałej.

Sygnał B (wnioskowanie na podstawie wzorca imienia i nazwiska). Imiona i nazwiska beneficjentów rzeczywistych są dopasowywane do słownika OSINT (§4) równolegle z sygnałem obywatelstwa. Sygnał nazwiskowy posiada własną podgrupę oraz poziom pewności.

Jak oba sygnały się łączą. Wnioskowanie na podstawie nazwiska nie jest wyłącznie rozwiązaniem zastępczym przy braku danych o obywatelstwie; służy również do wychwytywania przypadków naturalizacji, w których paszport nie odzwierciedla pochodzenia. Możliwe są trzy rezultaty:

• Sygnał obywatelstwa, ale brak dopasowania nazwiska: podgrupa wynikająca z obywatelstwa staje się podstawowym pochodzeniem podmiotu. Zadeklarowany paszport bez wzorca nazwiskowego to najmocniejszy przypadek, jakim dysponujemy.

• Obywatelstwo i nazwisko są zgodne: podmiot jest klasyfikowany według sygnału obywatelstwa, a zgodne dopasowanie nazwiska jest zapisywane jako wtórny sygnał potwierdzający.

• Obywatelstwo i nazwisko są niezgodne ALBO nie ma żadnego sygnału obywatelstwa: sygnał nazwiskowy staje się podstawowy. To ścieżka, która wychwytuje osobę o pochodzeniu indyjskim z paszportem kanadyjskim, osobę o pochodzeniu afrykańskim z paszportem francuskim, osobę o pochodzeniu pakistańskim z paszportem brytyjskim itd. Wychwytuje także przypadki, w których jedynym zadeklarowanym obywatelstwem jest polskie (czyli CRBR nie dostarcza sygnału zagranicznego), ale imię i nazwisko są wyraźnie niepolskie, w tym Polki, które wyszły za mąż za niebiałych mężczyzn i przyjęły nazwisko męża. Osoba z polskim paszportem zapisana jako MAGDALENA NGUYEN, ANNA OMONDI albo KATARZYNA SHARMA zostaje tutaj uwzględniona, ponieważ gospodarstwo domowe przyjęło niepolską tożsamość rodzinną, którą śledzimy przez sygnał nazwiska.

Dlaczego to ma znaczenie. Klasyfikator oparty wyłącznie na obywatelstwie systematycznie błędnie klasyfikowałby naturalizowane populacje niebiałe jako białe, ponieważ paszport kanadyjski, francuski, brytyjski czy niemiecki mapuje się do jednej z białych podgrup. Sygnał nazwiskowy koryguje ten problem, kosztem niższej pewności niż w przypadku paszportu, ponieważ nazwiska są wnioskowane, a nie deklarowane.

Każdy podmiot przechowuje oba sygnały, jeśli oba są obecne, dzięki czemu interfejs może pokazać użytkownikowi, która ścieżka wygenerowała widoczną etykietę. Przełącznik „Uwzględnij wnioskowanie na podstawie nazwiska” kontroluje, czy klasyfikacje podstawowe oparte na nazwisku są wyświetlane; wyłączenie go ogranicza widok do klasyfikacji potwierdzonych paszportem i przywraca przypadkom naturalizowanym to, co wynika z ich paszportu.

4. Wnioskowanie na podstawie nazwiska: jak to działa

Wnioskowanie na podstawie nazwiska jest najbardziej podatną na błędy częścią procesu i wymaga największej ostrożności. Przeczytaj tę sekcję, zanim będziesz cytować jakiekolwiek liczby oparte na wnioskowaniu.

Mechanika słownika. Słownik OSINT jest indeksowany według zapisanych wielkimi literami ciągów „IMIĘ NAZWISKO”. Obejmuje 2 418 niebiałych wnioskowań na podstawie nazwiska, wyodrębnionych spośród około 853 000 unikalnych imion i nazwisk właścicieli pozyskanych z KRS i CRBR (proces konstrukcji opisano w §1). Każdy wiersz zawiera pochodzenie imienia i nazwiska (np. „arabskie”, „wietnamskie”) oraz wskaźnik pewności dla danego wiersza. Dopasowanie odbywa się przez dokładną zgodność ciągów znaków: bez dopasowania rozmytego, bez dopasowania częściowego i bez awaryjnego dopasowania po samym nazwisku. Pełne imię i nazwisko osoby musi pojawić się w słowniku dokładnie, aby doszło do dopasowania.

Logika dla pojedynczego podmiotu. Gdy podmiot ma wielu beneficjentów rzeczywistych, imię i nazwisko każdego właściciela jest sprawdzane niezależnie. Jeśli co najmniej jeden właściciel daje niebiałe dopasowanie, podmiot dziedziczy podgrupę pochodzenia tego właściciela. Gdy dopasowuje się wielu właścicieli, wygrywa dopasowanie o najwyższej pewności. Jeśli żaden właściciel nie ma dopasowania w OSINT albo wszystkie dopasowania należą do białych podgrup, podmiot pozostaje przy klasyfikacji obywatelstwa z CRBR.

Dwa przypadki, w których wnioskowanie na podstawie nazwiska tworzy podstawowe pochodzenie podmiotu:

• Obywatelstwo i nazwisko są niezgodne: przypadek naturalizacji. Zadeklarowany paszport kanadyjski, francuski, brytyjski, niemiecki itd. u właściciela, którego wzorzec imienia i nazwiska wskazuje na pochodzenie indyjskie, afrykańskie, pakistańskie itd. Wnioskowanie na podstawie nazwiska staje się podstawowe; pierwotny sygnał paszportowy jest zachowywany wewnętrznie, aby przełącznik „Uwzględnij wnioskowanie na podstawie nazwiska” (§3) mógł go przywrócić.

• Brak użytecznego obywatelstwa zagranicznego: jedynym zadeklarowanym obywatelstwem jest polskie albo nie zadeklarowano żadnego obywatelstwa zagranicznego. Wnioskowanie na podstawie nazwiska zostaje podniesione do rangi sygnału podstawowego. To najczęstsza ścieżka dla właścicieli z polskim paszportem i nazwiskami o zagranicznym wzorcu. To również sposób, w jaki klasyfikator wychwytuje Polki, które wyszły za mąż za niebiałych mężczyzn i przyjęły nazwisko męża: formalnie polskie według paszportu, ale gospodarstwo domowe niesie teraz niebiałą tożsamość rodzinną przez nazwisko.

Jeden przypadek, w którym wnioskowanie na podstawie nazwiska NIE przejmuje pierwszeństwa:

• Obywatelstwo i nazwisko są zgodne: dopasowanie nazwiska jest zapisywane jako wtórny sygnał potwierdzający, a wartość wynikająca z obywatelstwa pozostaje podstawowym pochodzeniem.

Dlaczego to czasem prowadzi do błędów. Osoba o nazwisku „Lee” może być Chińczykiem, Koreańczykiem albo osobą pochodzenia anglosaskiego. Osoba o nazwisku „Rahman” może być Banglijczykiem, Pakistańczykiem albo przedstawicielem diaspory muzułmańskiej z innego miejsca. Osoba o nazwisku „Singh” najczęściej jest indyjskim Sikhem, ale jest to również popularne nazwisko pendżabskie występujące w wielu pochodzeniach południowoazjatyckich. Słownik OSINT wybiera najczęściej wskazywane przypisanie dla danego nazwiska, co w zauważalnej części przypadków będzie błędne.

Dlaczego pomija także rzeczywiste przypadki. Osoby, których oficjalne imiona i nazwiska zostały zanglicyzowane, zmienione przez małżeństwo albo w inny sposób zasymilowane, nie zostaną dopasowane. Klasyfikator systematycznie niedoszacowuje więc naturalizowane populacje niebiałe, których zapisane imiona i nazwiska nie odzwierciedlają wzorców pochodzenia przodków.

Jak klasyfikator kontroluje błąd. Wnioskowanie z nazwiska na tle nazwisk łudząco podobnych jest zaszumione i cały proces jest zbudowany z uwzględnieniem tego faktu. Pojedynczy przebieg po rejestrze oznacza dużą pulę „potencjalnie niebiałych”, silnie zanieczyszczoną transliterowanymi nazwiskami słowiańskimi, bałtyckimi, niemieckimi, greckimi i bałkańskimi — zmierzony względem pobranego obywatelstwa taki niefiltrowany przebieg jest w większości fałszywie dodatni. Dlatego klasyfikator jest warstwowy i celowo ostrożny, od sygnału o najwyższej pewności: pobrany paszport zawsze ma pierwszeństwo przed nazwiskiem; deterministyczne reguły nazwiskowe/imienne są włączane tylko, jeśli osiągają próg precyzji ≥0,95 na wydzielonej 20% próbie, a każda reguła emituje swoją zmierzoną precyzję jako pewność; pozostałe niepewne nazwiska wymagają zgodności dwóch przebiegów lub dwóch modeli, zanim skłonność ku niebiałej klasyfikacji zostanie uznana, przy czym najtrudniejsze przypadki rozstrzyga silny model z pełnym zestawem reguł redakcyjnych; a zarówno zbiór zachowany, jak i odrzucony podlegają wyrywkowej kontroli ludzkiej. Nazwisko, które nie przejdzie pewnie żadnego z tych etapów, pozostaje Nieznane, a nie zgadywane. Każdy zapisany werdykt rejestruje swoje źródło (obywatelstwo, słownik kuratorski, skalibrowaną regułę albo rozstrzygnięcie modelu) oraz wartość pewności, dzięki czemu bardziej wymagający czytelnik może pominąć niższe poziomy. Ten projekt „precyzja ponad pełność” to właśnie powód, dla którego publikowane liczby są dolną granicą, a nie górną (§11).

Nie cytuj pojedynczych podmiotów wyłącznie na podstawie wnioskowania z nazwiska. Zbiór danych został zbudowany do analizy trendów regionalnych i zagregowanych. Wskazywanie konkretnego wiersza w tabeli podmiotów i używanie wnioskowania na podstawie nazwiska jako podstawy twierdzenia o konkretnej osobie jest nieodpowiedzialne i nie znajduje oparcia w tej metodologii.

Jak to jest pokazywane. Wnioskowane pochodzenie jest cechą *podmiotu* (spółka jest osobą prawną, a nie osobą prywatną), więc to podmiot — a nie żadna osoba — nosi klasyfikację pochodzenia. Narzędzie nie przedstawia tego wnioskowania jako twierdzenia o konkretnej wskazanej osobie: imiona i nazwiska beneficjentów rzeczywistych pojawiają się wyłącznie tak, jak publikuje je rejestr źródłowy, a zadeklarowane obywatelstwo właściciela jest faktem rejestrowym, a nie wnioskowaniem etnicznym. Wnioskowanie o pochodzeniu jest pokazywane na poziomie działalności, nigdy jako etykieta etniczna przypisana do wskazanej osoby. Zagregowane widoki wzorców nazwisk („ile powtarzających się nazwisk danej formy”) liczą ciągi znaków — fakt dotyczący rejestru — i nie przypisują żadnej klasyfikacji pojedynczej osobie.

5. Decyzje redakcyjne

Niektóre decyzje klasyfikacyjne wymagają ludzkiej oceny, której nie da się rozstrzygnąć samym algorytmem. Wymieniamy je poniżej otwarcie, aby czytelnik, który nie zgadza się z którąkolwiek z nich, mógł odpowiednio dostosować swoją interpretację liczb.

Prywatność: imiona i nazwiska osób sklasyfikowanych jako białe są anonimizowane. Tam, gdzie podmiot jest sklasyfikowany jako biały (polskie, ukraińskie, białoruskie, rosyjskie, inne europejskie, anglosfera), imiona i nazwiska beneficjentów rzeczywistych oraz osób pełniących funkcje są zastępowane stałym znacznikiem (`*** ***`), zanim kiedykolwiek opuszczą bazę danych. Jest to celowa ochrona osób prywatnych, które nie są głównym przedmiotem zainteresowania tego projektu. Ich dane istnieją w rejestrach źródłowych. KRS i CRBR są rejestrami publicznymi, ale Monitor Imigracji ich nie publikuje ponownie. Właściciele podmiotów sklasyfikowanych jako niebiałe są pokazywani z prawdziwymi imionami i nazwiskami, ponieważ redakcyjnym celem projektu jest dokumentowanie niebiałej aktywności gospodarczej w Polsce, a imiona i nazwiska osób prowadzących tę działalność są częścią tego zapisu.

Klasyfikacja pochodzenia dotyczy podmiotu, a nie wskazanej osoby. Spółka jest osobą prawną, a etykieta pochodzenia jest cechą tej spółki. Narzędzie nie przedstawia pochodzenia jako etykiety etnicznej dla żadnej osoby i nie wyróżnia, które nazwisko dało klasyfikację wnioskowaną z nazwiska (zob. §4). Imiona i nazwiska właścicieli pojawiają się tak, jak publikuje je rejestr, a zadeklarowane obywatelstwo — fakt rejestrowy, a nie wnioskowanie etniczne — może być pokazane; tym, czego nie pokazujemy, jest przypisanie klasyfikacji etnicznej do konkretnej wskazanej osoby. Mapa i liczby wzorców nazwisk są zagregowane, a pojedyncze wiersze są wierne rejestrowi.

Reguła podmiotu: jeden niebiały właściciel wyznacza pochodzenie całego podmiotu. Jeśli podmiot ma co najmniej jednego beneficjenta rzeczywistego sklasyfikowanego jako niebiały (na podstawie obywatelstwa albo nazwiska), cały podmiot dziedziczy pochodzenie tego właściciela. Konkretny przykład: podmiot z pięcioma właścicielami sklasyfikowanymi jako polscy i jednym właścicielem sklasyfikowanym jako arabski zostaje sklasyfikowany jako arabski, a nie polski, „mieszany” ani ważony według udziałów. Sygnał niebiały wygrywa niezależnie od tego, ilu innych właścicieli tego samego podmiotu ma klasyfikację białą. Rozważaliśmy alternatywy wymagające większościowego udziału albo ważenia według procentu własności, ale obie systematycznie niedoszacowują firmy o mieszanej własności, w których niepolski założyciel lub wspólnik jest właśnie przedmiotem zainteresowania projektu. Gdy w tym samym podmiocie pojawia się więcej niż jedna klasyfikacja niebiała (np. jeden właściciel indyjski + jeden arabski), wygrywa klasyfikacja o najwyższej pewności.

Gospodarstwa domowe z małżeństw mieszanych są klasyfikowane według nazwiska. Kobieta o polskim imieniu i wietnamskim, indyjskim lub arabskim nazwisku jest klasyfikowana według nazwiska, a nie imienia; gospodarstwo domowe jest częścią sygnału redakcyjnego, który śledzi projekt.

Muzułmańskie nazwiska kaukaskie są rozdzielane. Nazwiska czeczeńskie i dagestańskie (z imionami takimi jak MAGOMED, AKHMED, ISLAM) są klasyfikowane jako arabskie, co odzwierciedla redakcyjne skupienie na migracji o pochodzeniu muzułmańskim niezależnie od tego, która postsowiecka republika wydała paszport. Azerbejdżańskie nazwiska turkijskie (kończące się na -OV/-EV i połączone z turkijskimi imionami) są klasyfikowane jako tureckie (turkijska rodzina językowa). Nazwiska gruzińskie (kończące się na -DZE, -SHVILI, -IANI) należą do chrześcijańskiego Kaukazu i są klasyfikowane jako inne europejskie.

Miejsce zamieszkania właściciela: pojedynczy właściciel mieszkający za granicą klasyfikuje cały podmiot jako zagraniczny. Filtr w panelu podmiotu dzieli zbiór danych na „W Polsce” i „Za granicą” na podstawie pola `country_of_residence` z CRBR. Reguła jest asymetryczna, analogicznie do opisanej wyżej reguły pochodzenia podmiotu: wystarczy jeden beneficjent rzeczywisty z zadeklarowanym miejscem zamieszkania poza Polską, aby cały podmiot trafił do „Za granicą”, niezależnie od tego, ilu współwłaścicieli mieszka w Polsce. Kategoria przeciwna, „W Polsce”, oznacza więc, że każdy właściciel z wpisanym miejscem zamieszkania mieszka w Polsce (właściciele bez wpisanego miejsca zamieszkania nie dyskwalifikują podmiotu). Obowiązuje tu ten sam kompromis co przy regule pochodzenia: wariant oparty na większościowym udziale albo ważony procentem własności systematycznie zaniżałby liczbę firm o mieszanej własności, w których nawet pojedynczy zagraniczny wspólnik jest sygnałem redakcyjnym istotnym dla projektu.

Te decyzje są wersjonowane. Powyższe reguły nie są ocenami wstecznymi; są zapisane w klasyfikatorze i stosowane jednolicie wobec każdego podmiotu w zbiorze danych.

6. Kategorie pochodzenia

Taksonomia porządkuje podgrupy w ramach siedmiu grup nadrzędnych. Każda podgrupa jest powiązana ze zbiorem kodów krajów ISO 3166-1 alpha-2; obywatelstwo dowolnego z tych krajów, zgodnie z zapisem w CRBR, przypisuje właściciela do danej podgrupy. Pełne mapowanie znajduje się poniżej.

Podgrupy „Inne” są jasno oznaczonymi kategoriami resztowymi. W ramach każdej grupy nadrzędnej „Inne” obejmuje pochodzenia rzeczywiste, ale zbyt mało liczne w tym zbiorze danych, aby uzasadniały osobną podgrupę: na przykład nepalskie i lankijskie w Azji Południowej albo wietnamskie, filipińskie i środkowoazjatyckie w Azji. Kategoria resztowa istnieje właśnie po to, aby podmiot o rzeczywistym, lecz rzadkim pochodzeniu nie został po cichu wrzucony do jednej z nazwanych podgrup.

Grupa nadrzędna Inne pełni dwie funkcje. Po pierwsze, mieści podmioty bez żadnego użytecznego sygnału pochodzenia: Nieznane (klasyfikator nie zwrócił wyniku) i Niesklasyfikowane (kody krajów obecne w CRBR, ale niemapujące się na żadną populację istotną dla tego projektu). Po drugie, mieści pięć podgrup specyficznych dla konkretnych krajów (Południowoafrykańskie, Brazylijskie, Argentyńskie, Chilijskie, Urugwajskie) dla obywatelstw, których wzorzec emigracji systematycznie odbiega od większości populacji danego kraju. Uzasadnienie opisano w następnym akapicie.

Dlaczego pięć obywatelstw trafia do Inne / <kraj>. Republika Południowej Afryki, Brazylia, Argentyna, Chile i Urugwaj mają wzorce emigracji do Europy, które wyraźnie odbiegają od większości populacji każdego z tych krajów: emigracja afrykanerska, anglosaska i żydowska z kraju o większości czarnoskórej oraz emigracja osób pochodzenia europejskiego z krajów Ameryki Południowej, których ludność stanowią głównie populacje mieszane lub rdzenne. Klasyfikator oparty wyłącznie na obywatelstwie kierowałby brazylijski paszport do LATAM / Ameryka Południowa, a paszport południowoafrykański do Czarne / Afryka, co jest błędnym wnioskiem dla dominującego strumienia migracyjnego, jaki obserwujemy w rejestrze. Skierowanie tych pięciu obywatelstw do podgrupy specyficznej dla kraju w ramach Inne zachowuje sygnał obywatelstwa w sposób przejrzysty i audytowalny, bez zawyżania sum dla grupy Czarnej lub LATAM. Tam, gdzie Sygnał B (wnioskowanie z nazwiska) dostarcza mocniejszego sygnału pochodzenia dla konkretnego podmiotu, nadpisuje domyślną klasyfikację obywatelstwa w standardowy sposób.

Dlaczego jedenaście kodów offshore i terytoriów zamorskich zostało przeniesionych z Czarne / Inne. Wcześniejsze wersje tej taksonomii kierowały dwanaście kodów (AI, AS, BM, CW, KY, MH, MP, PF, PG, PN, VI, VU) do rezydualnej podgrupy Czarne / Inne na podstawie ogólnego założenia, że nie są one ani europejskie, ani należące do MENA, ani wschodnioazjatyckie, ani południowoazjatyckie. Audyt wobec rzeczywistych zarejestrowanych właścicieli pokazał, że było to błędne dla wszystkich poza jednym. Brytyjskie Terytoria Zamorskie (AI, BM, KY, PN) oraz Wyspy Dziewicze Stanów Zjednoczonych (VI) noszą obywatelstwo państwa-macierzy do celów obywatelstwa; obserwowani w rejestrze właściciele to brytyjscy lub amerykańscy finansiści i kontrolerzy spółek-słupów, a nie mieszkańcy Pacyfiku lub Karaibów, więc zostali przeniesieni do Białe / Anglosfera. Właściciele z Curaçao (CW) noszą obywatelstwo holenderskie i zostali przeniesieni do Białe / Inne europejskie. Samoa Amerykańskie (AS), Polinezja Francuska (PF), Wyspy Marshalla (MH), Mariany Północne (MP) oraz Vanuatu (VU) pokazały inny wzorzec: większość właścicieli miała polskie imiona, polskie miejsce zamieszkania oraz polskie powiązania biznesowe, co jest spójne z programami obywatelstwa-przez-inwestycję, użyciem adresu pocztowego albo błędami wprowadzania danych po stronie źródła mylącymi wizualnie podobne dwuliterowe kody (PL błędnie wpisane jako PF stanowiło największe pojedyncze skupisko). Aby uniknąć kolorowania tych właścicieli jako Czarnych na podstawie statusu prawnego dogodności, który nie odpowiada ich pochodzeniu etnicznemu, pięć kodów odstających zostało przeniesionych do Inne / Niesklasyfikowane. Papua-Nowa Gwinea (PG) jest jedynym kodem, który pozostaje w Czarne / Inne, ponieważ jej melanezyjska większość populacji to jedyny przypadek, w którym pierwotne przypisanie odpowiadało obserwowanym właścicielom.

Białe / polskie
PL
Białe / ukraińskie
UA
Białe / białoruskie
BY
Białe / rosyjskie
RU
Białe / zachodnio- i północnoeuropejskie
DE, FR, NL, AT, BE, NO, DK, SE, CH, LI, IE, LU, IS, AD, MC, JE, GG, IM, GI, AX, FI
Białe / południowoeuropejskie
IT, ES, PT, MT, GR, CY
Białe / środkowoeuropejskie
CZ, SK, HU
Białe / bałtyckie
LT, LV, EE
Białe / bałkańskie
RO, MD, BG, HR, RS, AL, SI, XK, ME, BA, MK
Białe / anglosfera
GB, US, CA, AU, NZ, AI, BM, KY, VI, PN
MENA / tureckie
TR
MENA / irańskie
IR
MENA / izrael
IL
MENA / północnoafrykańskie
EG, DZ, TN, MA, LY
MENA / lewantyńskie
LB, SY, JO, PS
MENA / Zatoki Perskiej
SA, AE, KW, QA, BH, OM
MENA / irackie
IQ
MENA / jemeńskie
YE
Azja Południowa / indyjskie
IN
Azja Południowa / pakistańskie
PK
Azja Południowa / bangladeskie
BD
Azja Południowa / afgańskie
AF
Azja Południowa / nepalskie
NP
Azja Południowa / lankijskie
LK
Azja / chińskie
CN, TW, HK
Azja / koreańskie
KR, KP
Azja / japońskie
JP
Azja / mongolskie
MN
Kaukaz / gruzińskie
GE
Kaukaz / ormiańskie
AM
Kaukaz / azerbejdżańskie
AZ
Azja Środkowa / uzbeckie
UZ
Azja Środkowa / kazachstańskie
KZ
Azja Środkowa / tadżyckie
TJ
Azja Środkowa / kirgiskie
KG
Azja Środkowa / turkmeńskie
TM
Azja Południowo-Wschodnia / wietnamskie
VN
Azja Południowo-Wschodnia / filipińskie
PH
Azja Południowo-Wschodnia / tajskie
TH
Azja Południowo-Wschodnia / malezyjskie
MY
Azja Południowo-Wschodnia / indonezyjskie
ID
Azja Południowo-Wschodnia / kambodżańskie
KH
Azja Południowo-Wschodnia / laotańskie
LA
Azja Południowo-Wschodnia / singapurskie
SG
Czarne / nigeryjskie
NG
Czarne / zimbabweńskie
ZW
Czarne / etiopskie
ET
Czarne / rwandyjskie
RW
Czarne / kenijskie
KE
Czarne / ghańskie
GH
Czarne / inne zachodnioafrykańskie
GN, SN, CI, GM, BJ, LR, ML, SL, TG
Czarne / środkowoafrykańskie
CM, CD, CG, CF, TD, AO
Czarne / inne wschodnioafrykańskie
SD, TZ, UG, BI, SO, ER
Czarne / inne południowoafrykańskie
BW, SZ, ZM, NA
Czarne / południowo-wschodnioafrykańskie i Ocean Indyjski
MZ, KM, MG, MU, SC
Czarne / karaiby
AG, BB, BS, DM, GD, HT, JM, KN, LC, TT
Czarne / inne
PG (+ wnioskowane z imion afrykańskie o nieznanym kraju)
LATAM / ameryka południowa
BO, CO, EC, PE, PY, VE
LATAM / ameryka środkowa
CR, GT, HN, MX, NI, PA, SV, BZ
LATAM / karaiby
CU, DO, PR
Inne / południowoafrykańskie
ZA
Inne / brazylijskie
BR
Inne / argentyńskie
AR
Inne / chilijskie
CL
Inne / urugwajskie
UY
Inne / wyspy Pacyfiku
AS, MH, MP, PF, VU
Inne / nieznane
(brak danych o obywatelstwie; klasyfikator nie zwrócił wyniku)
Inne / niesklasyfikowane
TF, GS, XX, QV (+ wnioskowane z imion żydowskie bez paszportu izraelskiego)

7. Kategorie sektorów

Oprócz wymiarów „kim są” i „gdzie się znajdują”, omówionych w §3 i §8, projekt udostępnia trzeci wymiar: „czym się zajmują”. Każdy podmiot jest przypisywany do jednej z jedenastu głównych kategorii rodzajów działalności wraz z dodatkową rezydualną kategorią Inne / Niesklasyfikowane, na podstawie zarejestrowanego kodu PKD. Kategorie zasilają filtr sektorowy, tabelę krzyżową pochodzenie × sektor oraz kartę porównawczą bazowa wobec filtra.

PKD (Polska Klasyfikacja Działalności) to oficjalna polska taksonomia rodzajów działalności gospodarczej, zgodna z unijnym standardem NACE Rev. 2. Każdy podmiot KRS rejestruje jeden podstawowy kod PKD i może zarejestrować dodatkowe kody uzupełniające. Kody składają się z dwucyfrowego działu oraz jednoliterowej podklasy (np. 56.10.A dla restauracji), pogrupowanych pod dwudziestoma jeden literami sekcji od A do U. Do klasyfikacji w kategoriach używamy wyłącznie kodu podstawowego; kody uzupełniające są przechowywane, lecz nie są wykorzystywane do filtrowania ani agregacji. Kod podstawowy to ten, który podmiot sam zadeklarował przy rejestracji jako swoją główną działalność, a konsekwentne korzystanie z niego utrzymuje kategorie jako spójny, dobrze zdefiniowany widok, a nie nakładające się dopasowanie typu „dowolny z”. Firma, której rzeczywista struktura działalności zmieniła się po rejestracji, albo której faktyczne przychody koncentrują się w zarejestrowanym kodzie uzupełniającym, nadal zostanie sklasyfikowana zgodnie ze swoim kodem podstawowym.

Jedenaście kategorii treściowych. Każda sekcja PKD jest przypisana do dokładnie jednej kategorii; żaden podmiot z rozpoznanym podstawowym kodem PKD nie pozostaje bez przypisania. Gastronomia i noclegi obejmują sekcję I — czyli restauracje, bary i catering (dział 56) oraz hotele, hostele i najem krótkoterminowy (dział 55). W bazie KRS dominują wpisy gastronomiczne, ale słowo „noclegi” pokrywa zarówno klasyczne hotele, jak i platformy typu Airbnb. Handel detaliczny obejmuje dział 47. Handel hurtowy obejmuje dział 46. Motoryzacja obejmuje dział 45 (handel i naprawa pojazdów), oddzielony od handlu detalicznego i hurtowego, ponieważ jego profil działalności różni się od obu. Budownictwo obejmuje sekcję F. Transport i logistyka obejmuje sekcję H. IT i telekom obejmuje sekcję J. Usługi profesjonalne obejmują sekcję M (prawne, doradcze, architektura, reklama, badania i rozwój). Usługi osobiste obejmują sekcje R i S (sztuka, rekreacja, kosmetyka, naprawy). Nieruchomości i finanse obejmują sekcje K i L. Produkcja i przemysł obejmują sekcje A (rolnictwo), B (górnictwo), C (produkcja), D (energetyka, gaz) oraz E (gospodarka wodna, odpady). Pełne odwzorowanie działów na kategorie znajduje się w repozytorium projektu; jedenaście powyższych etykiet to poziom czytelny na ekranie.

Inne / Niesklasyfikowane łączą dwie odrębne populacje pod jedną etykietą. Po pierwsze, sekcje PKD, których celowo nie wyodrębniamy do osobnej kategorii: N (działalność w zakresie usług administrowania), O (administracja publiczna), P (edukacja), Q (opieka zdrowotna i pomoc społeczna), T (gospodarstwa domowe), U (organizacje i zespoły eksterytorialne). To rzeczywiste kody reprezentujące rzeczywistą działalność gospodarczą, znajdujące się jednak poza jedenastoma kategoriami, które filtr w interfejsie wyróżnia jako wymiar głównego poziomu. Po drugie, podmioty z pustym podstawowym kodem PKD, czyli około 13,3 procent całej populacji (118 047 podmiotów według ostatniego przebiegu weryfikacyjnego). To wpisy KRS, w których nie zarejestrowano żadnego kodu działalności; jest to luka w jakości danych po stronie źródła, a nie wybór klasyfikacyjny. Łączna etykieta jest zamierzona: czytelnik analizujący liczebności kategorii widzi, jak duży jest osad, bez ukrywania go w kategorii sugerującej strukturę, której tam nie ma.

Starsze i nieprawidłowo zapisane kody PKD korzystają z dopasowania awaryjnego po literze sekcji. Niewielka liczba wpisów KRS zawiera kody ze starszego standardu PKD 2004 (najczęściej działy 67, 34 i 40, które w PKD 2007 zostały przenumerowane odpowiednio na 66, 29 i 35), same litery sekcji (`A..`, `DB`, `G..`) albo kody odwołujące się do działów, które nie istnieją w żadnym z dwóch standardów. Mechanizm rozpoznawania najpierw próbuje dopasowania po dwucyfrowym dziale, uwzględniając trzy działy ze standardu PKD 2004 wchłonięte do odpowiednich kategorii PKD 2007; jeśli to się nie powiedzie, korzysta z dopasowania pierwszego znaku kodu w tabeli liter sekcji. Sekcja G (handel) jest wewnętrznie podzielona między handel detaliczny, handel hurtowy oraz handel pojazdami, dlatego sam zapis `G..` domyślnie trafia do handlu hurtowego, który jest najczęstszym agregatem handlu poza detalicznym, gdy nie podano działu. Sekcje N, O, P, Q, T, U trafiają wszystkie do kategorii Inne / Niesklasyfikowane. Osiemnaście podmiotów (0,002 procent zbioru danych) zawiera kody zbyt uszkodzone dla obu metod dopasowania i trafia do kategorii Inne jako ostateczna pozostałość.

Tryb mapy: kolorowanie według sektora. Przełącznik kolorowania mapy ma dwa tryby: według kategorii pochodzenia (domyślny redakcyjnie) oraz według kategorii sektora. W trybie sektora każda kropka jest pokolorowana zgodnie z kategorią, do której rozwiązuje się jej podstawowy kod PKD, przy użyciu tych samych jedenastu kolorów, które oznaczają chipy w panelu filtrów. Dopasowanie awaryjne po literze sekcji, używane przez backend, nie jest stosowane w wyrażeniu kolorowania GL na mapie: wspomnianych wyżej osiemnaście podmiotów z nieprawidłowo zapisanymi kodami renderuje się na mapie w kolorze Inne / Niesklasyfikowane, nawet jeśli widok tabeli, korzystający z mechanizmu rozpoznawania w backendzie, skierowałby niektóre z nich gdzie indziej. To najbezpieczniejsze możliwe błędne pokolorowanie (w stronę kategorii rezydualnej) i dotyczy znikomo małej części zbioru danych.

8. Wizualizacje mapy i przypisanie do województw

Główny widok mapy udostępnia trzy wizualizacje tych samych danych o współrzędnych podmiotów, przełączane przez użytkownika z poziomu kontrolek mapy:

Mapa cieplna. Ciągły gradient gęstości rysowany bezpośrednio na podstawie punktów podmiotów, bez dyskretnych komórek. Najlepsza do szybkiego zauważania koncentracji.

Punkty. Jeden znacznik na podmiot, umieszczony w jego zgeokodowanych współrzędnych. Najlepsze do identyfikowania pojedynczych firm i ich dokładnej lokalizacji przy dużym przybliżeniu; przy małym przybliżeniu widok staje się nieczytelny, ponieważ skupiska punktów nakładają się na siebie w jedną plamę.

Skupiska. Te same punkty podmiotów co w widoku Punkty, ale przy małym przybliżeniu agregowane przestrzennie w okręgi, których wielkość odzwierciedla liczbę podmiotów wewnątrz, a kolor — dominującą grupę pochodzenia (lub kategorię PKD, gdy aktywne jest „Koloruj wg sektora”). Kliknij skupisko, aby zobaczyć rozkład; przy dużym przybliżeniu skupiska rozpadają się na pojedyncze punkty.

Filtry działają jednolicie. Kategoria pochodzenia, okres czasu, przełącznik wnioskowania na podstawie nazwiska oraz przełącznik NGO zmniejszają widoczny zbiór podmiotów; aktywna wizualizacja zawsze odzwierciedla ten sam przefiltrowany podzbiór. Przełączanie między mapą cieplną, punktami i skupiskami nigdy nie zmienia tego, które podmioty są liczone, lecz jedynie sposób ich przedstawienia.

Pokrycie geokodowania jest niższe niż 100%. Podmioty, których adresów nie udało się zgeokodować (literówki, błędnie sformatowane wpisy, adresy nierozpoznane przez geokoder), pojawiają się w tabeli, ale są nieobecne w warstwach mapy. Systematycznie niedoreprezentowuje to podmioty z bardzo wiejskich obszarów oraz podmioty niedawno zarejestrowane, których adresy mogły jeszcze nie trafić w uporządkowanej postaci do danych referencyjnych geokodera.

Przypisanie do województwa. Każdy podmiot jest przypisywany do jednego z szesnastu województw Polski podczas uzupełniania danych historycznych, przy użyciu testu punkt-w-poligonie: zgeokodowane współrzędne podmiotu są sprawdzane względem oficjalnych wielokątów granic każdego województwa, a podmiot zostaje zapisany jako należący do tego województwa, którego poligon zawiera dany punkt. To przypisanie zasila warstwę granic województw na mapie oraz wszystkie liczniki regionalne.

Przypadki graniczne. Dwa rodzaje błędów mogą umieścić podmiot w „niewłaściwym” województwie: (1) zgeokodowane współrzędne podmiotu są lekko przesunięte z powodu niejednoznaczności adresu, ulicy umieszczonej przez geokoder przy niewłaściwym końcu albo adresu rozpoznanego jako centroid miasta zamiast rzeczywistego budynku; oraz (2) rzeczywisty adres podmiotu znajduje się faktycznie na granicy województwa albo bardzo blisko niej. Polskie granice administracyjne są dobrze określone, ale precyzja geokodowania nie jest idealna, więc podmiot położony kilkaset metrów od granicy może trafić po niewłaściwej stronie. Nie stosujemy żadnej strefy buforowej ani korekty rozmytych granic; przypisanie zależy od tego, po której stronie linii znajdzie się zgeokodowany punkt. To niewielki efekt na poziomie agregatów, ale oznacza, że pojedynczych podmiotów położonych blisko granicy nie należy automatycznie uznawać za należące do województwa, które pokazuje mapa.

9. Wymiar czasowy

Dane historyczne są uporządkowane w okresy kwartalne w formacie YYYY-Qn (np. 2025-Q3). Najwcześniejsza pozycja na widocznym suwaku łączy wszystkie rejestracje sprzed 2012 roku w jeden punkt (zob. §2); od 2012-Q1 każda pozycja odpowiada jednemu kwartałowi.

Pominięcie ostatnich niepełnych kwartałów. Dwa najnowsze kwartały są pomijane w głównych metrykach. Ponieważ dane sięgają jedynie wczesnej wiosny 2026 roku, końcowe kwartały w tym zrzucie są częściowe; ich pominięcie zakotwicza wyświetlaną wartość „bieżącą” w pełnym okresie, a nie w okresie niepełnym.

10. Co wiemy na pewno, a co wnioskujemy

Czytelnik przeglądający wykres na tej stronie widzi mieszankę faktów i wnioskowań. Ta sekcja wyraźnie rozdziela te dwie rzeczy.

Wysoka pewność (dane mówią dokładnie to, co mówią). Istnienie podmiotu i metadane KRS: każdy podmiot w bazie odpowiada rzeczywistemu wpisowi KRS pobranemu bezpośrednio z publicznego API Ministerstwa Sprawiedliwości. Nazwa podmiotu, data rejestracji, zapisany adres, NIP/REGON, forma prawna, kody PKD oraz imiona, nazwiska i funkcje osób pełniących funkcje są faktami skopiowanymi ze źródła.

Wysoka pewność (klasyfikacja oparta na obywatelstwie; sygnał A w §3). Gdy CRBR zwraca beneficjenta rzeczywistego z obywatelstwem zagranicznym, znamy to obywatelstwo — jest to zapis Ministerstwa Finansów dotyczący tego, co zadeklarowano przy rejestracji. Przypisanie tego obywatelstwa do podgrupy jest wyborem taksonomicznym, a nie wnioskowaniem; fakt bazowy („ta osoba zadeklarowała obywatelstwo greckie”) jest twardą daną.

Średnia pewność (klasyfikacja na podstawie wzorca imienia i nazwiska; sygnał B w §3). Dopasowanie w OSINT mówi nam, że imię i nazwisko tej osoby odpowiada wzorcowi, który w źródłach publicznych jest kojarzony z określonym pochodzeniem. Nie mówi niczego ostatecznego o rzeczywistym pochodzeniu, etniczności ani autoidentyfikacji tej konkretnej osoby. Klasyfikacje wnioskowane z nazwiska należy traktować jako sygnał statystyczny na poziomie agregatów regionalnych, a nie jako fakt dotyczący pojedynczego wpisu.

Niższa pewność (geokodowanie). Pozycje punktów na mapie odzwierciedlają interpretację adresu przez geokoder; adresy, których geokoder nie potrafi rozpoznać, nie pojawiają się na mapie, ale nadal są w tabeli. Dokładność poniżej poziomu miasta nie powinna być używana do wyciągania wniosków na poziomie ulicy.

Brak pewności (prognozy, twierdzenia o etniczności konkretnych osób). Strona obecnie nie tworzy prognoz. Strona nie twierdzi, że zna etniczność, religię ani autoidentyfikację jakiejkolwiek konkretnej osoby — zob. §4 i §5.

11. Znane ograniczenia

Każdy zbiór danych ma ograniczenia. Ograniczenia Monitora Imigracji wymieniono poniżej w kolejności mniej więcej od największego do najmniejszego wpływu na interpretację.

Około 195 000 podmiotów to Nieznane; liczby niebiałe są dolną granicą, nie górną. Około 195 000 podmiotów w bazie nie ma żadnego użytecznego sygnału pochodzenia: CRBR nie zwrócił danych o beneficjentach rzeczywistych, nie zadeklarowano obywatelstwa zagranicznego, a żadne z zapisanych imion i nazwisk właścicieli nie pasowało do słownika OSINT. Podmioty te znajdują się w kategorii Nieznane i nie zasilają żadnej liczby niebiałej w tym narzędziu. Nieznana część z nich to firmy należące do niebiałych właścicieli, których po prostu nie udało nam się sklasyfikować. Każdy wykres w tym narzędziu należy czytać jako dolną granicę. Rzeczywisty udział niebiałych jest o nieznaną wartość wyższy.

Wnioskowanie na podstawie nazwiska nie znajdzie tego, czego nie wychwycił słownik. Proces konstrukcji opisany w §1 objął pełną pulę około 853 000 imion i nazwisk właścicieli, ale nadal jest to wnioskowanie, a nie wyrocznia. Imiona i nazwiska zanglicyzowane, zasymilowane, zmienione wskutek małżeństwa z polską rodziną, pochodzące z grup słabo reprezentowanych w danych treningowych oraz takie, które klasyfikator AI ocenił jako niejednoznaczne i dlatego ostrożnie odrzucił, przejdą do klasyfikacji po obywatelstwie albo do kategorii Nieznane. Wolimy raczej pominąć część przypadków niż błędnie je zaklasyfikować, co oznacza, że metodologia odzwierciedla wyłącznie to, co jesteśmy w stanie rozpoznać z rozsądną pewnością, a nie pełny obraz każdej firmy należącej do niebiałych właścicieli w Polsce.

Błąd wnioskowania z nazwiska jest niezerowy i kalibrowany warstwowo, a nie od początku do końca. §4 opisuje mechanizmy kontroli: reguły deterministyczne muszą osiągnąć próg precyzji ≥0,95 na wydzielonej 20% próbie, nazwiska niepewne wymagają zgodności dwóch przebiegów lub dwóch modeli, a pobrane obywatelstwo służy jako prawda odniesienia wszędzie tam, gdzie jest dostępne. Nie dysponujemy natomiast pojedynczą zmierzoną wartością dokładności dla całego klasyfikatora. Agregaty regionalne i grupowe należy traktować jako bardziej wiarygodne niż liczby pojedynczych podgrup, a liczby pojedynczych podgrup jako bardziej wiarygodne niż pojedynczy wiersz tabeli.

KRS i CEIDG to osobne rejestry o osobnym pokryciu. KRS obejmuje spółki z ograniczoną odpowiedzialnością, spółki akcyjne, fundacje i stowarzyszenia. Jednoosobowe działalności gospodarcze oraz przedsiębiorcy nierejestrowani w KRS rejestrują się w CEIDG, który narzędzie obecnie pobiera jako odrębną, osobno przełączaną warstwę (zob. §13), a nie łączy z liczbami KRS. Obu nigdy nie sumujemy po cichu: przełącznik rejestru wybiera spółki, jednoosobowe działalności albo oba, a każda liczba wskazuje, którego rejestru dotyczy. Liczbę wyłącznie z KRS należy czytać jako wykluczającą firmy jednoosobowe, a liczbę wyłącznie z CEIDG jako wykluczającą podmioty wpisane do KRS.

Pokrycie CRBR jest częściowe. Nie każdy podmiot KRS ma wpis w CRBR. Gdy CRBR nie zwraca informacji dla podmiotu, nie mamy zadeklarowanego sygnału obywatelstwa i podmiot przechodzi do wnioskowania na podstawie nazwiska, jeśli imiona i nazwiska właścicieli są dostępne, albo do kategorii Nieznane, jeśli nie są.

Wskaźnik niepowodzeń geokodowania jest niezerowy. Niektórych adresów nie udaje się rozpoznać. Te podmioty istnieją w naszych liczbach, ale brakuje ich na mapie.

Dane sięgają wczesnej wiosny 2026 roku. §2 omawia ten problem. Pozycja 2026-Q1 na suwaku oraz suma dla roku kalendarzowego 2026 są częściowe; będą wyglądały na mniejsze niż rzeczywiste albo prognozowane liczby dla tych okresów. Wszystko oznaczone jako „bieżące” albo „najnowsze” odnosi się do najnowszego pełnego okresu (2025-Q3), a nie do dnia dzisiejszego.

„Niebiałe” to grupowanie statystyczne, a nie deklaracja tożsamości. Etykieta odnosi się do wyniku klasyfikatora, który agreguje zadeklarowane obywatelstwo i sygnały oparte na wzorcu imienia i nazwiska. Nie jest to twierdzenie o autoidentyfikacji żadnego pojedynczego wpisu.

Migracja w czasie jest imputowana z aktualnych zapisów. Nie mamy historycznych danych o obywatelstwie dla poszczególnych osób. Podmiot pojawiający się w 2015-Q1 jest pokazywany zgodnie z klasyfikacją nadaną przez aktualny proces; jeśli obywatelstwo jego właścicieli zmieniło się między 2015 rokiem a dziś, używamy wartości aktualnej, a nie tej właściwej dla danego okresu.

Badanie w interesie publicznym, nie narzędzie dla służb porządkowych. Monitor Imigracji istnieje po to, aby pokazywać trendy w polskiej rejestracji podmiotów gospodarczych. Nie wolno używać go do namierzania osób lub firm, a zespół metodologiczny nie będzie pomagał żadnej stronie próbującej to robić.

12. Założenia

Kilka kluczowych założeń podtrzymuje liczby prezentowane w tym narzędziu. Każde z nich opisano wraz z uzasadnieniem, aby sceptyczny czytelnik mógł ocenić je samodzielnie.

Grupowanie „niebiałe” jest rozsądnym przybliżeniem pytania redakcyjnego. Zakładamy, że wynik klasyfikatora na poziomie grup, łączący sygnały obywatelstwa i nazwiska zgodnie z regułami z §3 i §5, przybliża odpowiedź na pytanie: „ile firm o pochodzeniu zagranicznym działa w każdym regionie?”. Grupowanie jest niedoskonałe, ale jest własną kategoryzacją tego zbioru danych, a nie etykietą zaimportowaną w całości od podmiotu trzeciego.

Sumy wojewódzkie są kompletne w ramach pokrycia KRS. Zakładamy, że KRS zwraca każdy podmiot zarejestrowany w jego ustawowym zakresie, bez próbkowania. Jeśli źródło wprowadzi próbkowanie, liczby w tym narzędziu staną się szacunkami, a nie sumami.

Klasyfikacja małżeństw mieszanych według nazwiska jest redakcyjnie właściwa. Zakładamy, że gospodarstwo domowe jest właściwą jednostką oraz że nazwisko oddaje tę jednostkę lepiej niż imię w typowym przypadku polskiego obywatela z zagranicznym małżonkiem. Czytelnik, który wolałby, aby dominowało imię, powinien mentalnie skorygować liczby polskich obywateli w górę, a liczby pochodzenia nazwiskowego w dół.

Podmioty zarejestrowane w KRS są właściwą jednostką analizy. Zakładamy, że liczenie rejestracji firm jest znaczącym sygnałem zagranicznej obecności gospodarczej. Inne ujęcia — zatrudnienie, przychody, dochód gospodarstwa domowego — dałyby inne liczby; wybraliśmy ujęcie, które jest bezpośrednio wspierane przez dostępne dane publiczne.

13. Jednoosobowe działalności (CEIDG)

Obok warstwy spółek z KRS druga warstwa obejmuje osoby prowadzące jednoosobową działalność gospodarczą zarejestrowane w CEIDG (Centralna Ewidencja i Informacja o Działalności Gospodarczej), publicznym rejestrze jednoosobowych firm. CEIDG jest jawne z mocy prawa; pokazujemy wyłącznie podzbiór sklasyfikowany jako „niebiały” tą samą metodą obywatelstwo-plus-nazwisko co dla KRS (§3). W ostatnim imporcie ten podzbiór liczy 30 667 jednoosobowych działalności, zagregowanych w 1534 gminach.

Nazwisko to nie pochodzenie etniczne, a wnioskowanie z nazwiska jest tu wyłącznie zagregowane. Kategorie pochodzenia opisują *statystyczny sygnał pochodzenia nazwiska lub zadeklarowanego obywatelstwa*, a nie etniczność, religię czy tożsamość osoby — „lewantyńskie” czy „wietnamskie” oznacza, że wzorzec nazwiska/obywatelstwa pasuje do danego pochodzenia, nic więcej. CEIDG stosuje tę samą metodę wnioskowania z nazwiska co KRS (§3, §4), ale z jedną kluczową różnicą w sposobie prezentacji: jednoosobowa działalność jest osobą fizyczną, a nie spółką, więc nie istnieje osoba prawna, do której można by przypisać pochodzenie wywnioskowane z nazwiska. Dlatego pojawia się ono wyłącznie w agregatach — kartogramie gmin, liczbach wzorców nazwisk oraz rozkładach pochodzenia/branży — nigdy jako klasyfikacja przy wskazanej osobie. Kategorie są opisami na poziomie populacji.

Mapa jest celowo zagregowana. Adres rejestracji CEIDG to często *domowy* adres osoby. Dlatego nigdy nie geokodujemy jednoosobowych działalności i nie nanosimy ich jako punktów — podstawową ochroną jest to, że żadna osoba nie jest umieszczana na mapie. Mapa cieniuje całe gminy; kartogram i okienko po kliknięciu pokazują wyłącznie liczby oraz rozkłady pochodzenia/branży dla całej gminy, nigdy nazwiska ani adresu.

Klucz lokalizacji. Rekordy są agregowane do 6-cyfrowego identyfikatora gminy TERYT; cyfry rozróżniające miasto/wieś oraz kody dzielnic są zwijane do gminy nadrzędnej, tak że każda gmina to jedna komórka. Około 20% rekordów nie ma użytecznego adresu, więc nigdy nie pojawia się na mapie, ale nadal jest liczone w zagregowanych wartościach wzorców nazwisk oraz pochodzenia/branży.

Powierzchnie CEIDG są zagregowane. Jednoosobowa działalność *jest* osobą fizyczną — firma i człowiek mają jedną tożsamość prawną — dlatego warstwa CEIDG jest prezentowana jako agregaty: mapa gmin, liczby wzorców nazwisk oraz rozkłady branż/pochodzenia, a nie profil pojedynczej osoby. Tam, gdzie zapisano obywatelstwo, jest ono pokazywane i grupowane geograficznie (fakt paszportowy), a nie przeetykietowane jako pochodzenie etniczne.

Czas to skumulowana rejestracja, a nie aktywność w danym momencie. Każda pozycja suwaka jest skumulowana: pokazuje każdą jednoosobową działalność *zarejestrowaną do końca danego kwartału*, wyłącznie na podstawie daty rozpoczęcia (`data_rozpoczęcia`, jedynego pola daty w CEIDG). Przesuwanie suwaka do przodu wyłącznie dodaje firmy, więc liczba w gminie jest monotonicznie niemalejąca — może się ustabilizować, ale nigdy nie spada. CEIDG nie zawiera daty zakończenia, wykreślenia ani zawieszenia, więc narzędzie nie może pokazać zamknięcia firmy w czasie i nie jest to szereg „aktywne w chwili T”.

Status to bieżący zrzut; widok domyślny to „aktywne na papierze”. Status każdego rekordu (aktywny / wykreślony / zawieszony) to stan rejestru na moment pobrania danych, bez historii — firma wykreślona dziś jest wykreślona w każdym punkcie osi czasu, a my nie wiemy, *kiedy* została wykreślona. Domyślnie pokazywane są tylko rekordy aktywne, więc domyślne powierzchnie to jednoosobowe działalności obecnie zarejestrowane i niezawieszone. „Aktywny” oznacza, że wpis w CEIDG jest żywy (osoba nie wyrejestrowała ani nie zawiesiła działalności), a nie że weryfikowalnie prowadzi handel — działalność uśpiona, lecz niezamknięta, wciąż jest aktywna. Spośród 30 667 sklasyfikowanych rekordów 13 796 jest obecnie aktywnych, 11 782 wykreślonych, a 4742 zawieszonych — czyli ponad połowa nie jest obecnie aktywna, a odczytywanie linii skumulowanej rejestracji jako „firmy działające wtedy” zawyża chwilową liczbę aktywnych, przy czym różnica rośnie im dalej wstecz patrzymy.