Gender-API vs. ChatGPT: co powinno określać płeć na podstawie imienia?
Oba powiedzą Ci, że Sandra jest zwykle imieniem żeńskim. Tylko jedno z nich powie Ci, skąd to wie, da tę samą odpowiedź za rok i wyceni milion imion, zanim zaczniesz.
Krótka odpowiedź
- Weź LLM, gdy potrzebujesz oceny kilku imion albo tekstu do czytania: wyjaśnienia, pochodzenia, zwrotu powitalnego.
- Weź bazę imion, gdy odpowiedź musi być jutro identyczna, musi przyjść z dowodami, musi mieć cenę za rekord albo musi wytrzymać pytanie inspektora ochrony danych.
- Przy dużej skali decyduje nie dokładność, a rozliczalność. 9,124,598 imion z 192 krajów, każda odpowiedź z własną liczbą próbek — przeciwko generowaniu, które nie potrafi pokazać, jak doszło do wyniku.
- Dobrze się łączą. Daj modelowi API jako narzędzie — udostępniamy do tego hostowany serwer MCP — wtedy etykieta pochodzi z danych, a sformułowanie od modelu.
Czym te dwie rzeczy właściwie są
Gender-API.com to usługa wyszukiwania w bazie imion. 9,124,598 imion, w podziale na kraj, w którym je zaobserwowano, 192 obsługiwanych krajów. Wysyłasz imię, dostajesz płeć, prawdopodobieństwo i liczbę próbek, na których opiera się odpowiedź. Nic nie jest generowane.
ChatGPT — jak każdy inny model językowy ogólnego przeznaczenia — jest generatorem tekstu. Wie, że „Sandra“ pojawia się w kontekstach żeńskich, bo tak zachowywało się to słowo w tekście treningowym. To naprawdę użyteczny sygnał i przy popularnych imionach daje właściwą etykietę. Ale w architekturze nie ma nic, co przechowuje, ile Sandr w Portugalii było kobietami — nie ma więc czego cytować, na czym ustawić progu ani czego skontrolować.
Ten jeden strukturalny fakt tłumaczy wszystkie praktyczne różnice poniżej.
PORÓWNANIE
Różnice, które zostają niezależnie od wybranego modelu.
| Czego potrzebujesz | Gender-API.com | LLM ogólnego przeznaczenia |
|---|---|---|
| Ta sama odpowiedź na to samo wejście, za każdym razem | Tak — to wyszukanie w bazie | Nie — próbkowanie, brzmienie promptu i wersja modelu ją przesuwają |
| Dowody za pojedynczą odpowiedzią | Liczba próbek i prawdopodobieństwo dla każdego wyniku i kraju | Brak; wartość pewności, jeśli o nią poprosisz, też jest wygenerowana |
| Pokrycie, które możesz podać na piśmie | 9,124,598 imion, 192 krajów | Nieznane i niepodane |
| Odpowiedzi zależne od kraju | Parametr kraju, locale lub IP zmienia wynik | Tylko jeśli napiszesz to w prompcie — i nadal jest to zgadywanie |
| Zachowanie za dwanaście miesięcy | Ten sam kontrakt endpointu, opublikowany jako OpenAPI; v1 i v2 nadal działają | Modele są wycofywane i wymieniane; odpowiedzi przesuwają się razem z nimi |
| Przetwarzanie wsadowe | 100 imion na zapytanie albo plik CSV do 10 milionów wierszy | Limity kontekstu, dzielenie na paczki, rate limity i ponowne próby piszesz sam |
| Jednostka kosztu | Jeden credit za wyszukanie, z paczki kupionej z góry | Tokeny wejściowe i wyjściowe — zależą od długości promptu i ponownych prób |
| Gdzie przetwarzane są dane | Serwery w Niemczech, przetwarzanie na terenie UE, DPA na życzenie | Zależy od dostawcy, planu i przydzielonego regionu |
| Rozdzielenie pełnego imienia i nazwiska, odczytanie imienia z adresu e-mail | Osobne endpointy | Prompt engineering — a w przypadkach brzegowych zawodzi bez ostrzeżenia |
| Imię, o którym nikt nie ma danych | Mówi to wprost — result_found jest false albo prawdopodobieństwo jest niskie | Odpowiada i tak, tym samym pewnym tonem |
| Wyjaśnienie imienia, jego pochodzenia lub wariantów | Nie do tego służy | Naprawdę lepsze — do tego właśnie jest model językowy |
Ile kosztuje określenie płci dla miliona imion?
Zamiast marketingowej liczby podajemy metodę, żebyś mógł przeliczyć ją po dzisiejszych stawkach.
Z API: Jedno wyszukanie to jeden credit. Nasza najlepsza opublikowana stawka ilościowa wychodzi na około €0.35 za 1000 imion, więc milion imion to około €349 netto — kwota stała, znana przed startem, na fakturze VAT. Credity z paczek jednorazowych nie tracą ważności.
Z LLM: Płacisz za tokeny, w obu kierunkach, za każde zapytanie i każdą ponowną próbę. Łączenie kilku imion w jeden prompt obniża koszt na imię, ale instrukcje wysyłasz ponownie z każdą paczką, długie imiona i nietypowe pisma kosztują więcej tokenów niż krótkie, a błędnie sformowana odpowiedź kosztuje Cię dodatkowo ponowną próbę. Wynik to szacunek, a nie liczba, którą wpiszesz do budżetu.
Uczciwie: przy kilku tysiącach imion model ogólny jest tak tani, że nic z tego nie ma znaczenia. Punkt przełamania przychodzi ze skalą — i wcześniej, niż sugeruje cena tokenów, bo cała praca programistyczna wokół paczkowania, ponownych prób i sprawdzania wyjścia przy endpoincie wyszukiwania po prostu znika.
Powtarzalność: punkt, który zwykle rozstrzyga
Przetwórz listę klientów dwa razy, dostań dwa różne wyniki, i masz problem, którego nie potrafisz wyjaśnić: który przebieg był poprawny, co się zmieniło i co powiesz osobie, do której w zeszłym miesiącu zwracano się „Pan“, a w tym „Pani“.
Wyszukanie jest deterministyczne. To samo imię z tym samym krajem zwraca tę samą płeć, to samo prawdopodobieństwo i tę samą liczbę próbek. Kiedy dane u podstawy rosną, liczba próbek rośnie razem z nimi — widocznie, w odpowiedzi — więc zmiana jest czymś, co możesz wskazać, a nie czymś, co po prostu się stało.
Odpowiedź generowana takiej gwarancji nie daje. Temperature, nowa wersja modelu, przepisany prompt systemowy, korekta bezpieczeństwa, o której nikt Ci nie powiedział: każde z nich może przewrócić imię z pogranicza i żadne nie zostawia śladu w Twoich danych.
Każda odpowiedź przychodzi z własnymi dowodami
Jedno zapytanie do endpointu v2:
POST https://gender-api.com/v2/gender/by-first-name
{ "first_name": "Sandra" }
{
"input": { "first_name": "Sandra" },
"details": {
"credits_used": 1,
"samples": 464,
"country": null,
"first_name_sanitized": "sandra",
"duration": "436ms"
},
"result_found": true,
"first_name": "Sandra",
"probability": 0.85,
"gender": "female"
}
Dwa pola robią to, czego nie daje żadna odpowiedź generowana. „samples“ mówi, na ilu obserwacjach opiera się odpowiedź, a „probability“ — jaki ich udział był żeński. Razem pozwalają ustawić własną granicę: przyjmować wyniki powyżej 0.9 przy przyzwoitej liczbie próbek, a resztę kierować do ręcznej weryfikacji, zamiast godzić się na jeden poziom pewności dla całej bazy.
Pełna dokumentacja: dokumentacja API v2.
To samo imię nie oznacza wszędzie tej samej płci
Andrea we Włoszech jest przeważnie męskie, a w Niemczech przeważnie żeńskie. Jean we Francji jest męskie, a w krajach angielskojęzycznych w dużej mierze żeńskie. Nikita w Rosji jest męskie, a poza nią zwykle żeńskie. To nie są egzotyczne przypadki brzegowe — to zwyczajne imiona na zwyczajnych listach klientów.
Zapytaj model ogólny bez podania kraju i dostaniesz odczyt, który dominował w jego tekście treningowym, czyli w praktyce angielskojęzyczny. API przyjmuje kraj wprost:
Locale (en_US) albo adres IP odwiedzającego działają tak samo dobrze, a na pytanie odwrotne jest osobny endpoint — z jakiego kraju pochodzi imię.
GDPR i to, gdzie faktycznie trafiają wysyłane przez Ciebie imiona
Imiona prawdziwych klientów to dane osobowe, więc jest to pytanie dla zakupów, a nie przypis. Co możemy powiedzieć wprost:
- Jesteśmy niemiecką firmą; wszystkie nasze serwery stoją w Niemczech, a dane są przetwarzane na terenie UE.
- Umowę o przetwarzaniu danych możesz zamówić w swoim koncie.
- Logi serwera zawierają przesłane imię i są przechowywane 14 dni, z powodów rozliczeniowych.
- Przesłane pliki CSV i Excel są zapisywane w postaci zaszyfrowanej i usuwane po dziesięciu dniach.
- Każdy zakup kończy się prawidłową fakturą VAT, a unijne numery VAT są obsługiwane poprawnie.
Czy dany dostawca modelu jest dopuszczalny dla tych samych danych, to pytanie do Twojego inspektora ochrony danych — ale pytanie dłuższe i takie, które musisz zadawać od nowa przy każdej zmianie podprzetwarzającego u dostawcy. Nasze odpowiedzi znajdziesz w przeglądzie prywatności.
Kiedy ChatGPT jest lepszym wyborem
Ta strona nie byłaby warta czytania, gdyby odpowiedź zawsze brzmiała „kup API“. Nie brzmi:
- Zadanie jednorazowe. Czterdzieści imion w arkuszu, żadnego procesu, nikt tego nigdy nie powtórzy.
- Chcesz uzasadnienia, nie etykiety: pochodzenia imienia, jego wariantów, jak zwykle się je skraca, jak uprzejmie zwrócić się do kogoś w danej kulturze.
- Imiona, których nie ma żadna baza: nowe twory, postacie fikcyjne, transliteracje nieobecne w żadnym rejestrze. Model postawi sensowną hipotezę tam, gdzie wyszukanie po prostu nic nie ma.
- Na wyjściu potrzebujesz swobodnego tekstu, nie pola: linijki powitania, a nie kolumny z płcią.
To nie jest wielkoduszność, sami korzystamy z nich tak samo: opisy pochodzenia imion na naszych własnych stronach generuje model językowy, bo tekst to właśnie to, w czym model językowy jest dobry.
Najlepsze jest jedno i drugie: pozwól modelowi wywołać API
Jeśli już budujesz na LLM, nie musisz wybierać. Nowoczesne modele wywołują narzędzia, a wyszukanie płci jest narzędziem idealnym: wąskie pytanie o odpowiedź faktograficzną, dla której model nie ma danych.
Udostępniamy hostowany serwer MCP, żeby każdy asystent lub agent obsługujący MCP mógł odpytywać bazę bezpośrednio. Jego narzędzia to query_first_name, query_full_name, query_email, get_country_of_origin i get_statistics.
Do własnych definicji narzędzi są oficjalne klienty dla dziewięciu języków (PHP, Python, Node, Java, Go, Ruby, Rust, Perl, .NET), opis OpenAPI oraz pod adresem /skill.md gotowy przewodnik wdrożeniowy, który możesz przekazać wprost asystentowi programistycznemu.
Właśnie o ten podział pracy chodzi: model decyduje, co zrobić, a baza decyduje, co jest prawdą.
Często zadawane pytania
Czy ChatGPT potrafi określić płeć na podstawie imienia?
Tak, a przy popularnych imionach zwykle trafia. Czego nie potrafi: powiedzieć, na ilu rekordach opiera się odpowiedź, zagwarantować dwukrotnie tej samej odpowiedzi ani dać innej odpowiedzi dla tego samego imienia w innym kraju. Odpowiada też z tą samą pewnością na imiona, których nigdy nie widział — i właśnie ten błąd ma znaczenie przy dużej skali.
Czy API do rozpoznawania płci jest dokładniejsze niż LLM?
Dla imienia, które jest w bazie imion, wyszukanie jest dokładne już z samej konstrukcji: podaje zaobserwowany rozkład, a nie wnioskowanie. Przy nieznanym imieniu nie można zaufać żadnemu z podejść, ale tylko wyszukanie się do tego przyznaje. Solidną różnicą nie jest jeden procent dokładności — jest to, że każde wyszukanie przychodzi z liczbą próbek i prawdopodobieństwem, dla których możesz ustawić próg.
Ile kosztuje określenie płci dla miliona imion?
W Gender-API jedno wyszukanie kosztuje jeden credit, więc milion imion to kwota stała i znana — około €349 netto przy naszej najlepszej opublikowanej stawce ilościowej, na fakturze VAT, ustalona przed startem. Przy LLM płacisz za tokeny w każdym zapytaniu i przy każdej ponownej próbie, więc rachunek zależy od długości promptu i można go tylko oszacować.
Czy mogę używać LLM i API do rozpoznawania płci razem?
Tak, i to najlepsze połączenie. Daj modelowi API jako narzędzie — udostępniamy dokładnie do tego hostowany serwer MCP — wtedy etykieta pochodzi z bazy, a sformułowanie od modelu. Model przestaje zgadywać fakty, dla których nie ma danych.
Czy to samo imię ma tę samą płeć w każdym kraju?
Nie, i właśnie tu prompt bez kraju zawodzi. Andrea we Włoszech jest przeważnie męskie, a w Niemczech przeważnie żeńskie; Jean we Francji jest męskie, a w krajach angielskojęzycznych w dużej mierze żeńskie. API przyjmuje kraj, locale lub adres IP i odpowiada dla tego kraju.
Co się dzieje z imieniem, którego baza nie zna?
Dostajesz result_found: false albo niskie prawdopodobieństwo przy małej liczbie próbek. To sygnał, na którym możesz działać: skieruj te rekordy do ręcznej weryfikacji albo sięgnij po model. Odpowiedź generatywna nie daje żadnego takiego sygnału.
Czy Gender-API jest zgodne z GDPR?
Jesteśmy niemiecką firmą, wszystkie serwery stoją w Niemczech, a dane są przetwarzane na terenie UE. Umowę o przetwarzaniu danych możesz zamówić w swoim koncie. Logi zapytań, które zawierają przesłane imię, są przechowywane 14 dni z powodów rozliczeniowych; przesłane pliki CSV i Excel są zapisywane w postaci zaszyfrowanej i usuwane po dziesięciu dniach.
SPRAWDŹ TO NA SWOICH IMIONACH
Każde konto zawiera 100 darmowych wyszukań miesięcznie — wystarczy, by sprawdzić imiona, w których LLM się pomylił. Bez karty kredytowej.
Dokumentacja API · Uzupełnij płeć w pliku CSV lub Excel · Serwer MCP