Gender-API vs. ChatGPT: co má určovat pohlaví podle jména?
Oba vám řeknou, že Sandra je většinou ženské jméno. Jen jeden z nich vám řekne, odkud to ví, dá vám stejnou odpověď i za rok a nacení milion jmen ještě předtím, než začnete.
Krátká odpověď
- Použijte LLM, když potřebujete posoudit několik jmen nebo text ke čtení: vysvětlení, původ, oslovení.
- Použijte databázi jmen, když odpověď musí být zítra totožná, musí přijít s doklady, musí mít cenu za záznam, nebo musí obstát před dotazem pověřence pro ochranu osobních údajů.
- Ve velkém objemu nerozhoduje přesnost, ale doložitelnost. 9,124,598 jmen z 192 zemí, každá odpověď s vlastním počtem vzorků — proti generování, které nedokáže ukázat, jak k výsledku došlo.
- Dobře se doplňují. Dejte modelu API jako nástroj — poskytujeme k tomu hostovaný MCP server — a označení pak přichází z dat, zatímco formulace od modelu.
Co ty dvě věci vlastně jsou
Gender-API.com je vyhledávací služba nad databází jmen. 9,124,598 jmen rozdělených podle země, ve které byla zaznamenána, 192 podporovaných zemí. Pošlete jméno a dostanete pohlaví, pravděpodobnost a počet vzorků, na nichž odpověď stojí. Nic se negeneruje.
ChatGPT — a každý jiný obecný jazykový model — je generátor textu. Ví, že „Sandra“ se objevuje v ženských kontextech, protože tak se to slovo chovalo v jeho trénovacím textu. To je opravdu užitečný signál a u běžných jmen dává správné označení. V architektuře ale není nic, co by uchovávalo, kolik Sander v Portugalsku bylo ženami — není tedy co citovat, na čem nastavit mez ani co ověřit.
Tento jediný strukturní fakt vysvětluje všechny praktické rozdíly níže.
SROVNÁNÍ
Rozdíly, které platí bez ohledu na to, jaký model zvolíte.
| Co potřebujete | Gender-API.com | Obecný LLM |
|---|---|---|
| Stejná odpověď na stejný vstup, pokaždé | Ano — jde o vyhledání v databázi | Ne — vzorkování, formulace promptu i verze modelu s ní hýbou |
| Doklady za jednou konkrétní odpovědí | Počet vzorků a pravděpodobnost u každého výsledku a každé země | Žádné; hodnota jistoty je, pokud si o ni řeknete, sama vygenerovaná |
| Pokrytí, které můžete uvést písemně | 9,124,598 jmen, 192 zemí | Neznámé a neuvedené |
| Odpovědi podle konkrétní země | Parametr země, locale nebo IP mění výsledek | Jen když to uvedete v promptu — a stále je to dohad |
| Chování za dvanáct měsíců | Stejný kontrakt endpointu zveřejněný jako OpenAPI; v1 i v2 stále běží | Modely se vyřazují a nahrazují; odpovědi se posouvají s nimi |
| Dávkové zpracování | 100 jmen na požadavek, nebo soubor CSV až s 10 miliony řádků | Limity kontextu, dělení na dávky, rate limity a opakování si napíšete sami |
| Jednotka ceny | Jeden credit za vyhledání, z balíčku zakoupeného předem | Tokeny na vstupu i výstupu — mění se s délkou promptu a opakováními |
| Kde se data zpracovávají | Servery v Německu, zpracování v rámci EU, DPA na vyžádání | Závisí na dodavateli, tarifu a přidělené oblasti |
| Rozdělení celého jména, získání jména z e-mailové adresy | Samostatné endpointy | Prompt engineering — a v hraničních případech selže bez upozornění |
| Jméno, ke kterému nikdo nemá data | Řekne to — result_found je false, nebo je pravděpodobnost nízká | Odpoví přesto, stejně sebejistým tónem |
| Vysvětlení jména, jeho původu nebo variant | K tomu to není | Skutečně lepší — právě k tomu jazykový model je |
Kolik stojí určení pohlaví u milionu jmen?
Místo marketingového čísla uvádíme postup, abyste si jej mohli přepočítat s dnešními cenami.
S API: Jedno vyhledání je jeden credit. Naše nejlepší zveřejněná objemová cena vychází přibližně na €0.35 za 1 000 jmen, takže milion jmen stojí okolo €349 bez DPH — pevná částka, známá před začátkem, na faktuře s DPH. Credity z jednorázových balíčků nepropadají.
S LLM: Platíte za tokeny v obou směrech, u každého požadavku i každého opakování. Spojení několika jmen do jednoho promptu sníží cenu na jméno, ale s každou dávkou posíláte instrukce znovu, dlouhá jména a neobvyklá písma stojí více tokenů než krátká a chybně tvarovaná odpověď vás stojí navíc i opakování. Výsledkem je odhad, ne číslo, které zapíšete do rozpočtu.
Abychom byli spravedliví: u několika tisíc jmen je obecný model tak levný, že nic z toho nehraje roli. Bod zlomu přichází s objemem — a dříve, než cena tokenů napovídá, protože veškerá práce okolo dávkování, opakování a kontroly výstupu u vyhledávacího endpointu prostě odpadá.
Reprodukovatelnost: bod, který obvykle rozhoduje
Zpracujte seznam zákazníků dvakrát, dostanete dva různé výsledky a máte problém, který neumíte vysvětlit: které spuštění bylo správné, co se změnilo a co řeknete člověku, kterého jste minulý měsíc oslovili „pane“ a tento měsíc „paní“.
Vyhledání je deterministické. Stejné jméno se stejnou zemí vrací stejné pohlaví, stejnou pravděpodobnost a stejný počet vzorků. Když podkladová data narostou, naroste s nimi i počet vzorků — viditelně, v odpovědi — takže změna je něco, na co můžete ukázat, a ne něco, co se prostě stalo.
Generovaná odpověď takovou záruku nedává. Hodnota temperature, nová verze modelu, přepsaný systémový prompt, bezpečnostní úprava, o které vám nikdo neřekl: každá z nich může překlopit hraniční jméno a žádná nenechá ve vašich datech stopu.
Každá odpověď si nese vlastní doklady
Jediný požadavek na endpoint v2:
POST https://gender-api.com/v2/gender/by-first-name
{ "first_name": "Sandra" }
{
"input": { "first_name": "Sandra" },
"details": {
"credits_used": 1,
"samples": 464,
"country": null,
"first_name_sanitized": "sandra",
"duration": "436ms"
},
"result_found": true,
"first_name": "Sandra",
"probability": 0.85,
"gender": "female"
}
Dvě pole odvedou práci, kterou žádná generovaná odpověď nenabídne. „samples“ udává, na kolika pozorováních odpověď stojí, a „probability“ jejich ženský podíl. Společně vám dovolí nastavit si vlastní hranici — přijímat výsledky nad 0.9 s rozumným počtem vzorků a zbytek posílat k ruční kontrole — místo toho, abyste pro celou databázi přijali jedinou úroveň jistoty.
Úplná reference: dokumentace API v2.
Stejné jméno neznamená všude stejné pohlaví
Andrea je v Itálii převážně mužské a v Německu převážně ženské jméno. Jean je ve Francii mužské a v anglicky mluvících zemích většinou ženské. Nikita je v Rusku mužské a jinde obvykle ženské. Nejde o exotické hraniční případy — jsou to běžná jména v běžných seznamech zákazníků.
Zeptejte se obecného modelu bez uvedení země a dostanete čtení, které převažovalo v jeho trénovacím textu, tedy v praxi anglické. API bere zemi výslovně:
Locale (en_US) nebo IP adresa návštěvníka fungují stejně dobře a pro obrácenou otázku existuje samostatný endpoint — z jaké země jméno pochází.
GDPR a to, kam zaslaná jména skutečně putují
Jména skutečných zákazníků jsou osobní údaje, takže jde o otázku pro nákup, ne o poznámku pod čarou. Co můžeme uvést jednoznačně:
- Jsme německá společnost; všechny naše servery stojí v Německu a data se zpracovávají v rámci EU.
- O smlouvu o zpracování osobních údajů můžete požádat ve svém účtu.
- Logy serveru obsahují zaslané jméno a uchovávají se 14 dní, z účetních důvodů.
- Nahrané soubory CSV a Excel se ukládají zašifrovaně a po deseti dnech se mažou.
- Každý nákup vytvoří řádnou fakturu s DPH a unijní DIČ jsou zpracována správně.
Zda je konkrétní dodavatel modelu přijatelný pro tatáž data, je otázka pro vašeho pověřence pro ochranu osobních údajů — ale otázka delší, a taková, kterou musíte klást znovu při každé změně dalšího zpracovatele u dodavatele. Naše odpovědi najdete v přehledu ochrany soukromí.
Kdy je ChatGPT lepší volbou
Tato stránka by nestála za čtení, kdyby odpověď vždy zněla „kupte si API“. Nezní:
- Jednorázová práce. Čtyřicet jmen v tabulce, žádný proces, nikdo to už nikdy nezopakuje.
- Chcete zdůvodnění, ne označení: původ jména, jeho varianty, jak se běžně zkracuje, jak někoho v dané kultuře zdvořile oslovit.
- Jména, která nemá žádná databáze: nové výtvory, fiktivní postavy, transliterace, jež nejsou v žádném registru. Model udělá rozumný odhad tam, kde vyhledání jednoduše nic nemá.
- Na výstupu potřebujete volný text, ne pole: řádek s oslovením místo sloupce s pohlavím.
Není to velkorysost, sami je používáme stejně: popisy původu jmen na našich vlastních stránkách generuje jazykový model, protože text je právě to, v čem je jazykový model dobrý.
Nejlepší je obojí: nechte model zavolat API
Pokud už stavíte na LLM, nemusíte volit. Moderní modely volají nástroje a vyhledání pohlaví je ideální nástroj: úzká otázka s faktickou odpovědí, ke které model nemá data.
Poskytujeme hostovaný MCP server, aby se každý asistent nebo agent podporující MCP mohl dotazovat databáze přímo. Jeho nástroje jsou query_first_name, query_full_name, query_email, get_country_of_origin a get_statistics.
Pro vlastní definice nástrojů jsou k dispozici oficiální klienti pro devět jazyků (PHP, Python, Node, Java, Go, Ruby, Rust, Perl, .NET), popis OpenAPI a na adrese /skill.md hotový implementační návod, který můžete předat přímo programovacímu asistentovi.
Právě o toto rozdělení práce jde: model rozhoduje, co udělat, databáze rozhoduje, co je pravda.
Často kladené otázky
Umí ChatGPT určit pohlaví podle jména?
Ano, a u běžných jmen se obvykle nemýlí. Co neumí: říct vám, na kolika záznamech odpověď stojí, zaručit dvakrát stejnou odpověď, nebo dát u téhož jména jinou odpověď pro jinou zemi. Stejně sebejistě také odpovídá u jmen, která nikdy neviděla — a právě tato chyba je ve velkém objemu podstatná.
Je API pro určení pohlaví přesnější než LLM?
U jména, které je v databázi jmen, je vyhledání přesné už svou konstrukcí: uvádí pozorované rozložení, ne odvozený závěr. U neznámého jména nelze věřit ani jednomu přístupu, ale jen vyhledání to přizná. Spolehlivým rozdílem není jedno procento přesnosti — je to skutečnost, že každé vyhledání přichází s počtem vzorků a s pravděpodobností, na které si můžete nastavit mez.
Kolik stojí určení pohlaví u jednoho milionu jmen?
U Gender-API stojí jedno vyhledání jeden credit, takže milion jmen je pevná a známá částka — přibližně €349 bez DPH při naší nejlepší zveřejněné objemové ceně, na faktuře s DPH, dohodnutá před začátkem. U LLM platíte za tokeny u každého požadavku i každého opakování, takže účet závisí na délce promptu a lze jej pouze odhadnout.
Mohu použít LLM a API pro určení pohlaví společně?
Ano, a je to nejlepší uspořádání. Dejte modelu API jako nástroj — přesně k tomu poskytujeme hostovaný MCP server — a označení pak přichází z databáze, zatímco formulace od modelu. Model přestane hádat u faktů, ke kterým nemá data.
Má stejné jméno v každé zemi stejné pohlaví?
Ne, a právě tady prompt bez země selhává. Andrea je v Itálii převážně mužské a v Německu převážně ženské jméno; Jean je ve Francii mužské a v anglicky mluvících zemích většinou ženské. API přijímá zemi, locale nebo IP adresu a odpovídá pro danou zemi.
Co se stane u jména, které databáze nezná?
Dostanete result_found: false, nebo nízkou pravděpodobnost s malým počtem vzorků. To je signál, se kterým můžete pracovat: pošlete tyto záznamy k ruční kontrole, nebo sáhněte po modelu. Generativní odpověď vám žádný takový signál nedá.
Je Gender-API v souladu s GDPR?
Jsme německá společnost, všechny servery stojí v Německu a data se zpracovávají v rámci EU. O smlouvu o zpracování osobních údajů můžete požádat ve svém účtu. Logy požadavků, které obsahují zaslané jméno, se z účetních důvodů uchovávají 14 dní; nahrané soubory CSV a Excel se ukládají zašifrovaně a po deseti dnech se mažou.
VYZKOUŠEJTE TO NA SVÝCH JMÉNECH
Každý účet obsahuje 100 bezplatných vyhledání za měsíc — dost na kontrolu jmen, u kterých se LLM zmýlil. Bez platební karty.
Dokumentace API · Doplnit pohlaví do souboru CSV nebo Excel · MCP server