Gender API
Zarejestruj się za darmo
Język expand_more

Gender-API vs. ChatGPT: co powinno określać płeć na podstawie imienia?

Oba powiedzą Ci, że Sandra jest zwykle imieniem żeńskim. Tylko jedno z nich powie Ci, skąd to wie, da tę samą odpowiedź za rok i wyceni milion imion, zanim zaczniesz.

Ostatni przegląd 2026-09-01 Napisane i utrzymywane przez zespół Gender-API.com

Krótka odpowiedź

  • Weź LLM, gdy potrzebujesz oceny kilku imion albo tekstu do czytania: wyjaśnienia, pochodzenia, zwrotu powitalnego.
  • Weź bazę imion, gdy odpowiedź musi być jutro identyczna, musi przyjść z dowodami, musi mieć cenę za rekord albo musi wytrzymać pytanie inspektora ochrony danych.
  • Przy dużej skali decyduje nie dokładność, a rozliczalność. 9,124,598 imion z 192 krajów, każda odpowiedź z własną liczbą próbek — przeciwko generowaniu, które nie potrafi pokazać, jak doszło do wyniku.
  • Dobrze się łączą. Daj modelowi API jako narzędzie — udostępniamy do tego hostowany serwer MCP — wtedy etykieta pochodzi z danych, a sformułowanie od modelu.
Jedno pytanie — czy Andrea w Niemczech jest imieniem męskim czy żeńskim — z dwiema odpowiedziami. Odpowiedź Gender-API zawiera gender female, probability 0.85, samples 464 i country DE i jest identyczna przy każdym kolejnym wywołaniu. Odpowiedź modelu językowego zawiera tylko etykietę female i zmienia się wraz z promptem, temperature i wersją modelu.
To samo pytanie i dwie odpowiedzi obok siebie.

Czym te dwie rzeczy właściwie są

Gender-API.com to usługa wyszukiwania w bazie imion. 9,124,598 imion, w podziale na kraj, w którym je zaobserwowano, 192 obsługiwanych krajów. Wysyłasz imię, dostajesz płeć, prawdopodobieństwo i liczbę próbek, na których opiera się odpowiedź. Nic nie jest generowane.

ChatGPT — jak każdy inny model językowy ogólnego przeznaczenia — jest generatorem tekstu. Wie, że „Sandra“ pojawia się w kontekstach żeńskich, bo tak zachowywało się to słowo w tekście treningowym. To naprawdę użyteczny sygnał i przy popularnych imionach daje właściwą etykietę. Ale w architekturze nie ma nic, co przechowuje, ile Sandr w Portugalii było kobietami — nie ma więc czego cytować, na czym ustawić progu ani czego skontrolować.

Ten jeden strukturalny fakt tłumaczy wszystkie praktyczne różnice poniżej.

PORÓWNANIE

Różnice, które zostają niezależnie od wybranego modelu.

Czego potrzebujesz Gender-API.com LLM ogólnego przeznaczenia
Ta sama odpowiedź na to samo wejście, za każdym razem Tak — to wyszukanie w bazie Nie — próbkowanie, brzmienie promptu i wersja modelu ją przesuwają
Dowody za pojedynczą odpowiedzią Liczba próbek i prawdopodobieństwo dla każdego wyniku i kraju Brak; wartość pewności, jeśli o nią poprosisz, też jest wygenerowana
Pokrycie, które możesz podać na piśmie 9,124,598 imion, 192 krajów Nieznane i niepodane
Odpowiedzi zależne od kraju Parametr kraju, locale lub IP zmienia wynik Tylko jeśli napiszesz to w prompcie — i nadal jest to zgadywanie
Zachowanie za dwanaście miesięcy Ten sam kontrakt endpointu, opublikowany jako OpenAPI; v1 i v2 nadal działają Modele są wycofywane i wymieniane; odpowiedzi przesuwają się razem z nimi
Przetwarzanie wsadowe 100 imion na zapytanie albo plik CSV do 10 milionów wierszy Limity kontekstu, dzielenie na paczki, rate limity i ponowne próby piszesz sam
Jednostka kosztu Jeden credit za wyszukanie, z paczki kupionej z góry Tokeny wejściowe i wyjściowe — zależą od długości promptu i ponownych prób
Gdzie przetwarzane są dane Serwery w Niemczech, przetwarzanie na terenie UE, DPA na życzenie Zależy od dostawcy, planu i przydzielonego regionu
Rozdzielenie pełnego imienia i nazwiska, odczytanie imienia z adresu e-mail Osobne endpointy Prompt engineering — a w przypadkach brzegowych zawodzi bez ostrzeżenia
Imię, o którym nikt nie ma danych Mówi to wprost — result_found jest false albo prawdopodobieństwo jest niskie Odpowiada i tak, tym samym pewnym tonem
Wyjaśnienie imienia, jego pochodzenia lub wariantów Nie do tego służy Naprawdę lepsze — do tego właśnie jest model językowy

Ile kosztuje określenie płci dla miliona imion?

Zamiast marketingowej liczby podajemy metodę, żebyś mógł przeliczyć ją po dzisiejszych stawkach.

Z API: Jedno wyszukanie to jeden credit. Nasza najlepsza opublikowana stawka ilościowa wychodzi na około €0.35 za 1000 imion, więc milion imion to około €349 netto — kwota stała, znana przed startem, na fakturze VAT. Credity z paczek jednorazowych nie tracą ważności.

Z LLM: Płacisz za tokeny, w obu kierunkach, za każde zapytanie i każdą ponowną próbę. Łączenie kilku imion w jeden prompt obniża koszt na imię, ale instrukcje wysyłasz ponownie z każdą paczką, długie imiona i nietypowe pisma kosztują więcej tokenów niż krótkie, a błędnie sformowana odpowiedź kosztuje Cię dodatkowo ponowną próbę. Wynik to szacunek, a nie liczba, którą wpiszesz do budżetu.

Uczciwie: przy kilku tysiącach imion model ogólny jest tak tani, że nic z tego nie ma znaczenia. Punkt przełamania przychodzi ze skalą — i wcześniej, niż sugeruje cena tokenów, bo cała praca programistyczna wokół paczkowania, ponownych prób i sprawdzania wyjścia przy endpoincie wyszukiwania po prostu znika.

Zobacz ceny hurtowe

Powtarzalność: punkt, który zwykle rozstrzyga

Przetwórz listę klientów dwa razy, dostań dwa różne wyniki, i masz problem, którego nie potrafisz wyjaśnić: który przebieg był poprawny, co się zmieniło i co powiesz osobie, do której w zeszłym miesiącu zwracano się „Pan“, a w tym „Pani“.

Wyszukanie jest deterministyczne. To samo imię z tym samym krajem zwraca tę samą płeć, to samo prawdopodobieństwo i tę samą liczbę próbek. Kiedy dane u podstawy rosną, liczba próbek rośnie razem z nimi — widocznie, w odpowiedzi — więc zmiana jest czymś, co możesz wskazać, a nie czymś, co po prostu się stało.

Odpowiedź generowana takiej gwarancji nie daje. Temperature, nowa wersja modelu, przepisany prompt systemowy, korekta bezpieczeństwa, o której nikt Ci nie powiedział: każde z nich może przewrócić imię z pogranicza i żadne nie zostawia śladu w Twoich danych.

To samo imię i ten sam kraj, sprawdzone w styczniu, czerwcu i grudniu, za każdym razem zwracają female z probability 0.85 i 464 samples. Odpowiedź generowana zwraca female, potem male, potem female — między czerwcem a grudniem wymieniono wersję modelu i nic w danych tego nie odnotowuje.
Przykładowo. To samo wejście, trzy przebiegi, jeden rok.

Każda odpowiedź przychodzi z własnymi dowodami

Jedno zapytanie do endpointu v2:

POST https://gender-api.com/v2/gender/by-first-name
{ "first_name": "Sandra" }
{
    "input":  { "first_name": "Sandra" },
    "details": {
        "credits_used": 1,
        "samples": 464,
        "country": null,
        "first_name_sanitized": "sandra",
        "duration": "436ms"
    },
    "result_found": true,
    "first_name": "Sandra",
    "probability": 0.85,
    "gender": "female"
}

Dwa pola robią to, czego nie daje żadna odpowiedź generowana. „samples“ mówi, na ilu obserwacjach opiera się odpowiedź, a „probability“ — jaki ich udział był żeński. Razem pozwalają ustawić własną granicę: przyjmować wyniki powyżej 0.9 przy przyzwoitej liczbie próbek, a resztę kierować do ręcznej weryfikacji, zamiast godzić się na jeden poziom pewności dla całej bazy.

Pełna dokumentacja: dokumentacja API v2.

To samo imię nie oznacza wszędzie tej samej płci

Andrea we Włoszech jest przeważnie męskie, a w Niemczech przeważnie żeńskie. Jean we Francji jest męskie, a w krajach angielskojęzycznych w dużej mierze żeńskie. Nikita w Rosji jest męskie, a poza nią zwykle żeńskie. To nie są egzotyczne przypadki brzegowe — to zwyczajne imiona na zwyczajnych listach klientów.

Zapytaj model ogólny bez podania kraju i dostaniesz odczyt, który dominował w jego tekście treningowym, czyli w praktyce angielskojęzyczny. API przyjmuje kraj wprost:

Dwa identyczne zapytania API dla imienia Andrea, różniące się tylko polem country. Country IT zwraca male, country DE zwraca female. Prompt bez podanego kraju zwraca ten odczyt, który dominował w tekście treningowym.
Dwa identyczne zapytania, różnica jednego pola, przeciwne odpowiedzi.

Locale (en_US) albo adres IP odwiedzającego działają tak samo dobrze, a na pytanie odwrotne jest osobny endpoint — z jakiego kraju pochodzi imię.

GDPR i to, gdzie faktycznie trafiają wysyłane przez Ciebie imiona

Imiona prawdziwych klientów to dane osobowe, więc jest to pytanie dla zakupów, a nie przypis. Co możemy powiedzieć wprost:

  • Jesteśmy niemiecką firmą; wszystkie nasze serwery stoją w Niemczech, a dane są przetwarzane na terenie UE.
  • Umowę o przetwarzaniu danych możesz zamówić w swoim koncie.
  • Logi serwera zawierają przesłane imię i są przechowywane 14 dni, z powodów rozliczeniowych.
  • Przesłane pliki CSV i Excel są zapisywane w postaci zaszyfrowanej i usuwane po dziesięciu dniach.
  • Każdy zakup kończy się prawidłową fakturą VAT, a unijne numery VAT są obsługiwane poprawnie.

Czy dany dostawca modelu jest dopuszczalny dla tych samych danych, to pytanie do Twojego inspektora ochrony danych — ale pytanie dłuższe i takie, które musisz zadawać od nowa przy każdej zmianie podprzetwarzającego u dostawcy. Nasze odpowiedzi znajdziesz w przeglądzie prywatności.

Kiedy ChatGPT jest lepszym wyborem

Ta strona nie byłaby warta czytania, gdyby odpowiedź zawsze brzmiała „kup API“. Nie brzmi:

  • Zadanie jednorazowe. Czterdzieści imion w arkuszu, żadnego procesu, nikt tego nigdy nie powtórzy.
  • Chcesz uzasadnienia, nie etykiety: pochodzenia imienia, jego wariantów, jak zwykle się je skraca, jak uprzejmie zwrócić się do kogoś w danej kulturze.
  • Imiona, których nie ma żadna baza: nowe twory, postacie fikcyjne, transliteracje nieobecne w żadnym rejestrze. Model postawi sensowną hipotezę tam, gdzie wyszukanie po prostu nic nie ma.
  • Na wyjściu potrzebujesz swobodnego tekstu, nie pola: linijki powitania, a nie kolumny z płcią.

To nie jest wielkoduszność, sami korzystamy z nich tak samo: opisy pochodzenia imion na naszych własnych stronach generuje model językowy, bo tekst to właśnie to, w czym model językowy jest dobry.

Najlepsze jest jedno i drugie: pozwól modelowi wywołać API

Jeśli już budujesz na LLM, nie musisz wybierać. Nowoczesne modele wywołują narzędzia, a wyszukanie płci jest narzędziem idealnym: wąskie pytanie o odpowiedź faktograficzną, dla której model nie ma danych.

Udostępniamy hostowany serwer MCP, żeby każdy asystent lub agent obsługujący MCP mógł odpytywać bazę bezpośrednio. Jego narzędzia to query_first_name, query_full_name, query_email, get_country_of_origin i get_statistics.

Do własnych definicji narzędzi są oficjalne klienty dla dziewięciu języków (PHP, Python, Node, Java, Go, Ruby, Rust, Perl, .NET), opis OpenAPI oraz pod adresem /skill.md gotowy przewodnik wdrożeniowy, który możesz przekazać wprost asystentowi programistycznemu.

Właśnie o ten podział pracy chodzi: model decyduje, co zrobić, a baza decyduje, co jest prawdą.

Często zadawane pytania

Czy ChatGPT potrafi określić płeć na podstawie imienia?

Tak, a przy popularnych imionach zwykle trafia. Czego nie potrafi: powiedzieć, na ilu rekordach opiera się odpowiedź, zagwarantować dwukrotnie tej samej odpowiedzi ani dać innej odpowiedzi dla tego samego imienia w innym kraju. Odpowiada też z tą samą pewnością na imiona, których nigdy nie widział — i właśnie ten błąd ma znaczenie przy dużej skali.

Czy API do rozpoznawania płci jest dokładniejsze niż LLM?

Dla imienia, które jest w bazie imion, wyszukanie jest dokładne już z samej konstrukcji: podaje zaobserwowany rozkład, a nie wnioskowanie. Przy nieznanym imieniu nie można zaufać żadnemu z podejść, ale tylko wyszukanie się do tego przyznaje. Solidną różnicą nie jest jeden procent dokładności — jest to, że każde wyszukanie przychodzi z liczbą próbek i prawdopodobieństwem, dla których możesz ustawić próg.

Ile kosztuje określenie płci dla miliona imion?

W Gender-API jedno wyszukanie kosztuje jeden credit, więc milion imion to kwota stała i znana — około €349 netto przy naszej najlepszej opublikowanej stawce ilościowej, na fakturze VAT, ustalona przed startem. Przy LLM płacisz za tokeny w każdym zapytaniu i przy każdej ponownej próbie, więc rachunek zależy od długości promptu i można go tylko oszacować.

Czy mogę używać LLM i API do rozpoznawania płci razem?

Tak, i to najlepsze połączenie. Daj modelowi API jako narzędzie — udostępniamy dokładnie do tego hostowany serwer MCP — wtedy etykieta pochodzi z bazy, a sformułowanie od modelu. Model przestaje zgadywać fakty, dla których nie ma danych.

Czy to samo imię ma tę samą płeć w każdym kraju?

Nie, i właśnie tu prompt bez kraju zawodzi. Andrea we Włoszech jest przeważnie męskie, a w Niemczech przeważnie żeńskie; Jean we Francji jest męskie, a w krajach angielskojęzycznych w dużej mierze żeńskie. API przyjmuje kraj, locale lub adres IP i odpowiada dla tego kraju.

Co się dzieje z imieniem, którego baza nie zna?

Dostajesz result_found: false albo niskie prawdopodobieństwo przy małej liczbie próbek. To sygnał, na którym możesz działać: skieruj te rekordy do ręcznej weryfikacji albo sięgnij po model. Odpowiedź generatywna nie daje żadnego takiego sygnału.

Czy Gender-API jest zgodne z GDPR?

Jesteśmy niemiecką firmą, wszystkie serwery stoją w Niemczech, a dane są przetwarzane na terenie UE. Umowę o przetwarzaniu danych możesz zamówić w swoim koncie. Logi zapytań, które zawierają przesłane imię, są przechowywane 14 dni z powodów rozliczeniowych; przesłane pliki CSV i Excel są zapisywane w postaci zaszyfrowanej i usuwane po dziesięciu dniach.

SPRAWDŹ TO NA SWOICH IMIONACH

Każde konto zawiera 100 darmowych wyszukań miesięcznie — wystarczy, by sprawdzić imiona, w których LLM się pomylił. Bez karty kredytowej.

Czat