Gender API
Registrace zdarma
Jazyk expand_more

Gender-API vs. ChatGPT: co má určovat pohlaví podle jména?

Oba vám řeknou, že Sandra je většinou ženské jméno. Jen jeden z nich vám řekne, odkud to ví, dá vám stejnou odpověď i za rok a nacení milion jmen ještě předtím, než začnete.

Naposledy zkontrolováno 2026-09-01 Napsal a spravuje tým Gender-API.com

Krátká odpověď

  • Použijte LLM, když potřebujete posoudit několik jmen nebo text ke čtení: vysvětlení, původ, oslovení.
  • Použijte databázi jmen, když odpověď musí být zítra totožná, musí přijít s doklady, musí mít cenu za záznam, nebo musí obstát před dotazem pověřence pro ochranu osobních údajů.
  • Ve velkém objemu nerozhoduje přesnost, ale doložitelnost. 9,124,598 jmen z 192 zemí, každá odpověď s vlastním počtem vzorků — proti generování, které nedokáže ukázat, jak k výsledku došlo.
  • Dobře se doplňují. Dejte modelu API jako nástroj — poskytujeme k tomu hostovaný MCP server — a označení pak přichází z dat, zatímco formulace od modelu.
Jedna otázka — je Andrea v Německu mužské, nebo ženské jméno — zodpovězená dvakrát. Odpověď Gender-API obsahuje gender female, probability 0.85, samples 464 a country DE a je při každém dalším volání totožná. Odpověď jazykového modelu obsahuje jen označení female a mění se s promptem, hodnotou temperature a verzí modelu.
Stejná otázka a dvě odpovědi vedle sebe.

Co ty dvě věci vlastně jsou

Gender-API.com je vyhledávací služba nad databází jmen. 9,124,598 jmen rozdělených podle země, ve které byla zaznamenána, 192 podporovaných zemí. Pošlete jméno a dostanete pohlaví, pravděpodobnost a počet vzorků, na nichž odpověď stojí. Nic se negeneruje.

ChatGPT — a každý jiný obecný jazykový model — je generátor textu. Ví, že „Sandra“ se objevuje v ženských kontextech, protože tak se to slovo chovalo v jeho trénovacím textu. To je opravdu užitečný signál a u běžných jmen dává správné označení. V architektuře ale není nic, co by uchovávalo, kolik Sander v Portugalsku bylo ženami — není tedy co citovat, na čem nastavit mez ani co ověřit.

Tento jediný strukturní fakt vysvětluje všechny praktické rozdíly níže.

SROVNÁNÍ

Rozdíly, které platí bez ohledu na to, jaký model zvolíte.

Co potřebujete Gender-API.com Obecný LLM
Stejná odpověď na stejný vstup, pokaždé Ano — jde o vyhledání v databázi Ne — vzorkování, formulace promptu i verze modelu s ní hýbou
Doklady za jednou konkrétní odpovědí Počet vzorků a pravděpodobnost u každého výsledku a každé země Žádné; hodnota jistoty je, pokud si o ni řeknete, sama vygenerovaná
Pokrytí, které můžete uvést písemně 9,124,598 jmen, 192 zemí Neznámé a neuvedené
Odpovědi podle konkrétní země Parametr země, locale nebo IP mění výsledek Jen když to uvedete v promptu — a stále je to dohad
Chování za dvanáct měsíců Stejný kontrakt endpointu zveřejněný jako OpenAPI; v1 i v2 stále běží Modely se vyřazují a nahrazují; odpovědi se posouvají s nimi
Dávkové zpracování 100 jmen na požadavek, nebo soubor CSV až s 10 miliony řádků Limity kontextu, dělení na dávky, rate limity a opakování si napíšete sami
Jednotka ceny Jeden credit za vyhledání, z balíčku zakoupeného předem Tokeny na vstupu i výstupu — mění se s délkou promptu a opakováními
Kde se data zpracovávají Servery v Německu, zpracování v rámci EU, DPA na vyžádání Závisí na dodavateli, tarifu a přidělené oblasti
Rozdělení celého jména, získání jména z e-mailové adresy Samostatné endpointy Prompt engineering — a v hraničních případech selže bez upozornění
Jméno, ke kterému nikdo nemá data Řekne to — result_found je false, nebo je pravděpodobnost nízká Odpoví přesto, stejně sebejistým tónem
Vysvětlení jména, jeho původu nebo variant K tomu to není Skutečně lepší — právě k tomu jazykový model je

Kolik stojí určení pohlaví u milionu jmen?

Místo marketingového čísla uvádíme postup, abyste si jej mohli přepočítat s dnešními cenami.

S API: Jedno vyhledání je jeden credit. Naše nejlepší zveřejněná objemová cena vychází přibližně na €0.35 za 1 000 jmen, takže milion jmen stojí okolo €349 bez DPH — pevná částka, známá před začátkem, na faktuře s DPH. Credity z jednorázových balíčků nepropadají.

S LLM: Platíte za tokeny v obou směrech, u každého požadavku i každého opakování. Spojení několika jmen do jednoho promptu sníží cenu na jméno, ale s každou dávkou posíláte instrukce znovu, dlouhá jména a neobvyklá písma stojí více tokenů než krátká a chybně tvarovaná odpověď vás stojí navíc i opakování. Výsledkem je odhad, ne číslo, které zapíšete do rozpočtu.

Abychom byli spravedliví: u několika tisíc jmen je obecný model tak levný, že nic z toho nehraje roli. Bod zlomu přichází s objemem — a dříve, než cena tokenů napovídá, protože veškerá práce okolo dávkování, opakování a kontroly výstupu u vyhledávacího endpointu prostě odpadá.

Zobrazit ceny podle objemu

Reprodukovatelnost: bod, který obvykle rozhoduje

Zpracujte seznam zákazníků dvakrát, dostanete dva různé výsledky a máte problém, který neumíte vysvětlit: které spuštění bylo správné, co se změnilo a co řeknete člověku, kterého jste minulý měsíc oslovili „pane“ a tento měsíc „paní“.

Vyhledání je deterministické. Stejné jméno se stejnou zemí vrací stejné pohlaví, stejnou pravděpodobnost a stejný počet vzorků. Když podkladová data narostou, naroste s nimi i počet vzorků — viditelně, v odpovědi — takže změna je něco, na co můžete ukázat, a ne něco, co se prostě stalo.

Generovaná odpověď takovou záruku nedává. Hodnota temperature, nová verze modelu, přepsaný systémový prompt, bezpečnostní úprava, o které vám nikdo neřekl: každá z nich může překlopit hraniční jméno a žádná nenechá ve vašich datech stopu.

Stejné jméno se stejnou zemí, dotázané v lednu, v červnu a v prosinci, vrací pokaždé female s probability 0.85 a 464 samples. Generovaná odpověď vrací female, pak male, pak female — mezi červnem a prosincem byla vyměněna verze modelu a v datech tuto změnu nic nezachycuje.
Ilustrativní. Stejný vstup, tři spuštění, jeden rok.

Každá odpověď si nese vlastní doklady

Jediný požadavek na endpoint v2:

POST https://gender-api.com/v2/gender/by-first-name
{ "first_name": "Sandra" }
{
    "input":  { "first_name": "Sandra" },
    "details": {
        "credits_used": 1,
        "samples": 464,
        "country": null,
        "first_name_sanitized": "sandra",
        "duration": "436ms"
    },
    "result_found": true,
    "first_name": "Sandra",
    "probability": 0.85,
    "gender": "female"
}

Dvě pole odvedou práci, kterou žádná generovaná odpověď nenabídne. „samples“ udává, na kolika pozorováních odpověď stojí, a „probability“ jejich ženský podíl. Společně vám dovolí nastavit si vlastní hranici — přijímat výsledky nad 0.9 s rozumným počtem vzorků a zbytek posílat k ruční kontrole — místo toho, abyste pro celou databázi přijali jedinou úroveň jistoty.

Úplná reference: dokumentace API v2.

Stejné jméno neznamená všude stejné pohlaví

Andrea je v Itálii převážně mužské a v Německu převážně ženské jméno. Jean je ve Francii mužské a v anglicky mluvících zemích většinou ženské. Nikita je v Rusku mužské a jinde obvykle ženské. Nejde o exotické hraniční případy — jsou to běžná jména v běžných seznamech zákazníků.

Zeptejte se obecného modelu bez uvedení země a dostanete čtení, které převažovalo v jeho trénovacím textu, tedy v praxi anglické. API bere zemi výslovně:

Dva identické API požadavky pro jméno Andrea, které se liší jen v poli country. Country IT vrací male, country DE vrací female. Prompt bez uvedené země vrací to čtení, které převažovalo v trénovacím textu.
Dva identické požadavky, rozdíl v jednom poli, protikladné odpovědi.

Locale (en_US) nebo IP adresa návštěvníka fungují stejně dobře a pro obrácenou otázku existuje samostatný endpoint — z jaké země jméno pochází.

GDPR a to, kam zaslaná jména skutečně putují

Jména skutečných zákazníků jsou osobní údaje, takže jde o otázku pro nákup, ne o poznámku pod čarou. Co můžeme uvést jednoznačně:

  • Jsme německá společnost; všechny naše servery stojí v Německu a data se zpracovávají v rámci EU.
  • O smlouvu o zpracování osobních údajů můžete požádat ve svém účtu.
  • Logy serveru obsahují zaslané jméno a uchovávají se 14 dní, z účetních důvodů.
  • Nahrané soubory CSV a Excel se ukládají zašifrovaně a po deseti dnech se mažou.
  • Každý nákup vytvoří řádnou fakturu s DPH a unijní DIČ jsou zpracována správně.

Zda je konkrétní dodavatel modelu přijatelný pro tatáž data, je otázka pro vašeho pověřence pro ochranu osobních údajů — ale otázka delší, a taková, kterou musíte klást znovu při každé změně dalšího zpracovatele u dodavatele. Naše odpovědi najdete v přehledu ochrany soukromí.

Kdy je ChatGPT lepší volbou

Tato stránka by nestála za čtení, kdyby odpověď vždy zněla „kupte si API“. Nezní:

  • Jednorázová práce. Čtyřicet jmen v tabulce, žádný proces, nikdo to už nikdy nezopakuje.
  • Chcete zdůvodnění, ne označení: původ jména, jeho varianty, jak se běžně zkracuje, jak někoho v dané kultuře zdvořile oslovit.
  • Jména, která nemá žádná databáze: nové výtvory, fiktivní postavy, transliterace, jež nejsou v žádném registru. Model udělá rozumný odhad tam, kde vyhledání jednoduše nic nemá.
  • Na výstupu potřebujete volný text, ne pole: řádek s oslovením místo sloupce s pohlavím.

Není to velkorysost, sami je používáme stejně: popisy původu jmen na našich vlastních stránkách generuje jazykový model, protože text je právě to, v čem je jazykový model dobrý.

Nejlepší je obojí: nechte model zavolat API

Pokud už stavíte na LLM, nemusíte volit. Moderní modely volají nástroje a vyhledání pohlaví je ideální nástroj: úzká otázka s faktickou odpovědí, ke které model nemá data.

Poskytujeme hostovaný MCP server, aby se každý asistent nebo agent podporující MCP mohl dotazovat databáze přímo. Jeho nástroje jsou query_first_name, query_full_name, query_email, get_country_of_origin a get_statistics.

Pro vlastní definice nástrojů jsou k dispozici oficiální klienti pro devět jazyků (PHP, Python, Node, Java, Go, Ruby, Rust, Perl, .NET), popis OpenAPI a na adrese /skill.md hotový implementační návod, který můžete předat přímo programovacímu asistentovi.

Právě o toto rozdělení práce jde: model rozhoduje, co udělat, databáze rozhoduje, co je pravda.

Často kladené otázky

Umí ChatGPT určit pohlaví podle jména?

Ano, a u běžných jmen se obvykle nemýlí. Co neumí: říct vám, na kolika záznamech odpověď stojí, zaručit dvakrát stejnou odpověď, nebo dát u téhož jména jinou odpověď pro jinou zemi. Stejně sebejistě také odpovídá u jmen, která nikdy neviděla — a právě tato chyba je ve velkém objemu podstatná.

Je API pro určení pohlaví přesnější než LLM?

U jména, které je v databázi jmen, je vyhledání přesné už svou konstrukcí: uvádí pozorované rozložení, ne odvozený závěr. U neznámého jména nelze věřit ani jednomu přístupu, ale jen vyhledání to přizná. Spolehlivým rozdílem není jedno procento přesnosti — je to skutečnost, že každé vyhledání přichází s počtem vzorků a s pravděpodobností, na které si můžete nastavit mez.

Kolik stojí určení pohlaví u jednoho milionu jmen?

U Gender-API stojí jedno vyhledání jeden credit, takže milion jmen je pevná a známá částka — přibližně €349 bez DPH při naší nejlepší zveřejněné objemové ceně, na faktuře s DPH, dohodnutá před začátkem. U LLM platíte za tokeny u každého požadavku i každého opakování, takže účet závisí na délce promptu a lze jej pouze odhadnout.

Mohu použít LLM a API pro určení pohlaví společně?

Ano, a je to nejlepší uspořádání. Dejte modelu API jako nástroj — přesně k tomu poskytujeme hostovaný MCP server — a označení pak přichází z databáze, zatímco formulace od modelu. Model přestane hádat u faktů, ke kterým nemá data.

Má stejné jméno v každé zemi stejné pohlaví?

Ne, a právě tady prompt bez země selhává. Andrea je v Itálii převážně mužské a v Německu převážně ženské jméno; Jean je ve Francii mužské a v anglicky mluvících zemích většinou ženské. API přijímá zemi, locale nebo IP adresu a odpovídá pro danou zemi.

Co se stane u jména, které databáze nezná?

Dostanete result_found: false, nebo nízkou pravděpodobnost s malým počtem vzorků. To je signál, se kterým můžete pracovat: pošlete tyto záznamy k ruční kontrole, nebo sáhněte po modelu. Generativní odpověď vám žádný takový signál nedá.

Je Gender-API v souladu s GDPR?

Jsme německá společnost, všechny servery stojí v Německu a data se zpracovávají v rámci EU. O smlouvu o zpracování osobních údajů můžete požádat ve svém účtu. Logy požadavků, které obsahují zaslané jméno, se z účetních důvodů uchovávají 14 dní; nahrané soubory CSV a Excel se ukládají zašifrovaně a po deseti dnech se mažou.

VYZKOUŠEJTE TO NA SVÝCH JMÉNECH

Každý účet obsahuje 100 bezplatných vyhledání za měsíc — dost na kontrolu jmen, u kterých se LLM zmýlil. Bez platební karty.

Chat