Gender API
Registrace zdarma
Jazyk expand_more

Jak vybrat API na určení pohlaví

Každý poskytovatel v této kategorii vám řekne, že je přesný, a žádný z nich to neměřil na vašem seznamu. Tady je, co je skutečně odlišuje — a pod každým bodem naše vlastní odpověď, abyste stejné otázky mohli klást i nám.

Naposledy zkontrolováno 2026-09-01 Napsal a spravuje tým Gender-API.com

Krátká odpověď

  • Porovnávejte podle toho, co vám dá jeden výsledek — na pouhý štítek hranici nenasadíte, na pravděpodobnost s počtem vzorků ano. To rozhoduje, zda část souboru zautomatizujete, nebo celý zpracujete ručně.
  • Ignorujte procenta přesnosti z titulků, i ta naše — my žádné nezveřejňujeme, protože jsme je neměřili na zveřejněném srovnání. Změřte si to místo toho sami na několika stech vlastních řádků.
  • Větší databáze jmen není automaticky lepší: jméno se počítá stejně, ať za ním stojí tři záznamy, nebo padesát tisíc.
  • Pak zkontrolujte čtyři věci, na které se zapomíná — lokalizaci podle země, stabilitu odpovědi v letech, co se vrátí u neznámého jména a kde se data zpracovávají.

Začněte tím, co vám dá jediný výsledek

Toto je kritérium, které mění objem práce, jenž vám zůstane, a je vidět v ukázkové odpovědi poskytovatele, ještě než cokoli podepíšete.

Stejný dotaz vrácený třemi způsoby. Samotný štítek pohlaví vám nedá nic, na co byste nasadili hranici, takže každý řádek se buď přijme naslepo, nebo se zkontroluje. Přidaná pravděpodobnost umožní nastavit hranici jistoty, ale nerozliší 0,98 opřenou o tři záznamy od 0,98 opřené o tři tisíce. Když se přidá i počet vzorků, víte, zda ta jistota stojí na dostatku podkladů, aby se jí dalo věřit. Užitečná otázka není, jak přesný je poskytovatel, ale co vám jediný výsledek dá do ruky pro rozhodnutí.
Rozdíl není v přesnosti — je v tom, zda můžete jednat na jednom řádku, aniž byste se podívali na všechny.

Samotný štítek pohlaví je rozsudek bez postupu. Můžete ho použít všude, nebo ho všude kontrolovat; nic mezi tím není. Pravděpodobnost vám dá hranici. Pravděpodobnost s počtem záznamů za ní vám řekne, zda ta hranice pro řádek před vámi vůbec něco znamená — protože jistě vypadající odpověď opřená o tři záznamy a odpověď opřená o tisíce vypadají naprosto stejně, dokud vám někdo ten počet neukáže.

Naše odpověď: každý výsledek nese pravděpodobnost a počet vzorků a výstup CSV/Excel je zapíše do vašeho souboru jako sloupce, takže stejná hranice funguje, ať voláte API, nebo otevíráte tabulku.

Šest oblastí, které se vyplatí zkontrolovat

Šest míst, v nichž se poskytovatelé v této kategorii obvykle liší, a u každého to, co děláme my. Levý sloupec říká, na co se dívat — nikoho jiného jsme neprověřovali, takže nic z toho není tvrzení o konkrétním poskytovateli. Předložte to každému na svém krátkém seznamu, včetně nás.

Šest oblastí, které se u každého poskytovatele určení pohlaví ze jména vyplatí zkontrolovat, u každé to, co děláme my. Jedna odpověď na jméno bez ohledu na zemi proti lokalizaci podle země, locale nebo IP — Andrea je v Itálii mužské a v Německu ženské jméno. Štítek, za nímž nic nestojí, proti pravděpodobnosti a počtu vzorků u každého výsledku. Vysoký počet jmen bez podkladů u jednotlivého jména proti 9 124 598 jménům, kde každý výsledek nese svůj vlastní počet. Posouzení až po obchodním jednání proti 100 bezplatným dotazům za měsíc bez karty. Kapacita, která propadá, nebo roční vázanost proti předplaceným kreditům, které nikdy nepropadají, či měsíčnímu tarifu vypověditelnému kdykoli. Rozhraní jen v angličtině proti webu a dokumentaci v 16 jazycích.
Levý sloupec říká, co si ověřit; není to tvrzení o někom konkrétním — jiné poskytovatele jsme neprověřovali.

K posledním dvěma bodům: kredity zakoupené jako jednorázový paket nepropadají a měsíční tarif se obnovuje každý měsíc a lze ho kdykoli vypovědět (změna paketu znamená vypovědět a vybrat jiný). Obojí je v plném rozsahu na stránce s cenami, bez nutnosti poptávky.

Proč to číslo o pokrytí nerozhodne

Dvě jména v téže databázi. Obě se do procenta pokrytí v titulku počítají naprosto stejně, ale jedno stojí na desítkách tisíc záznamů a lze je použít automaticky, zatímco druhé stojí na třech a mělo by se pozdržet. Celkový počet jmen je nerozliší; dokáže to jen počet vzorků u jednotlivého výsledku.
Proč je celkový počet jmen špatné kritérium volby.

Držíme 9,124,598 jmen ze 192 zemí a dáváme tato čísla na úvodní stránku jako všichni ostatní. Mají cenu právě tuto: říkají vám, jak často vůbec dostanete odpověď, a nic o tom, zda konkrétní odpověď stojí za použití. Nevybírejte podle nich — ani podle našich, ani podle čísel kohokoli jiného.

Test, který to rozhodne, vyjde na jedno odpoledne: vezměte několik set řádků z vlastních dat, u nichž už znáte správnou odpověď, přidejte i ty, u nichž očekáváte potíže, a nechte je projít každým poskytovatelem na svém krátkém seznamu. Jména, která všichni určí správně, vám neřeknou nic.

Kontrolní seznam

Devět otázek v pořadí, v jakém obvykle záleží. Naše odpověď je v pravém sloupci — položte totéž každému, koho zvažujete, a odpovědi si vyžádejte písemně, ne z tabulky funkcí.

Zeptejte se Proč na tom záleží Naše odpověď
Co obsahuje jeden výsledek? Rozhoduje, zda můžete zautomatizovat jisté řádky a zkontrolovat jen zbytek Pohlaví, pravděpodobnost a počet záznamů za ní
Může stejné jméno odpovědět různě podle země? Andrea je v Itálii mužské a v Německu ženské jméno; jediná globální odpověď je v jedné z těch zemí špatná Ano — podle kódu země, locale prohlížeče nebo IP adresy
Odpoví stejný dotaz příští rok stejně? Audit se ptá, jak byl záznam klasifikován, a měnící se odpověď nelze vysvětlit Ano — je to aritmetika nad uloženými záznamy, ne vygenerovaný odhad
Co se vrátí u jména, které nezná? Prázdné pole lze odfiltrovat; věrohodný odhad nerozpoznáte Výslovné „nenalezeno“ a počet vzorků, který říká proč — nikdy vymyšlená odpověď
Existuje cesta, která nepotřebuje programátora? Ten, kdo má seznam, obvykle není ten, kdo umí zavolat API Nahrání CSV a Excelu se zachováním původního souboru
Kde se data zpracovávají a existuje smlouva o zpracování? Seznam jmen zákazníků jsou osobní údaje a nákupní oddělení se na to zeptá, ještě než spustíte provoz Německá společnost, servery v Německu, zpracování v EU, smlouva o zpracování na vyžádání
Propadá nevyužitá kapacita? Jednorázový úklid dat by neměl vyžadovat předplatné, které ho přežije Předplacené kredity, a nepropadají
Můžu to otestovat, než s někým budu mluvit? Pokud posouzení vyžaduje obchodní jednání, krátký seznam za odpoledne neporovnáte 100 bezplatných dotazů za měsíc, bez karty, bez telefonátu
Jaká je zveřejněná přesnost? Jediné procento popisuje sadu jmen, na níž bylo měřeno, a ta není vaše Žádné nezveřejňujeme — viz níže

Procento přesnosti, které vám nedáme

Na tomto trhu vám budou uvádět procenta. My žádné měřené k uvedení nemáme: neexistuje naše zveřejněné srovnání na označené sadě jmen, takže každé číslo, které bychom vytiskli, by bylo marketingové číslo v bílém plášti. Radši to řekneme než abychom nějaké vyšperkovali.

Je to také méně užitečné, než to zní. Přesnost určení pohlaví ze jména závisí téměř výhradně na tom, na která jména se ptáte — seznam běžných německých křestních jmen a seznam transliterovaných příjmení z desítky písem nevydá stejné číslo u žádného poskytovatele na světě. Jediné procento tedy vypovídá o sadě, na níž bylo měřeno, a váš seznam tou sadou není.

Když vám nějaké uvedou, otázka, která mu dá smysl, zní: měřeno na kterých jménech, kolika, označených kým a s „neznámým“ počítaným jako co? Pokud tyto odpovědi nejsou k dispozici, je to procento ozdoba.

Jak posouzení zvládnout za odpoledne

Tato stránka vám pořád říká, ať to změříte na vlastních datech, takže tady je postup. Zabere odpoledne, funguje stejně u každého poskytovatele na vašem krátkém seznamu a pátý krok je ten, který rozhodne o projektu.

  • 1. Vytáhněte 200–300 řádků, u kterých už odpověď znáte. Z reálných dat, ne ze seznamu slavných jmen. Záměrně přidejte ty nepříjemné: vzácná jména, nezápadní jména, záznamy s příjmením na prvním místě, jednoslovná jména, jména se spojovníkem a jména po svatbě.
  • 2. Nejdřív je nečistěte. Mezery na konci, titulky, „Dr.“ a VERZÁLKY jsou součástí toho, co testujete. Poskytovatel, který funguje jen na uklizeném vstupu, váš problém nevyřešil.
  • 3. Uchovejte celou odpověď, ne jen štítek. V pátém kroku budete potřebovat pravděpodobnost a počet vzorků, a pokud je poskytovatel nevrací, je to samo o sobě výsledek testu.
  • 4. Počítejte tři výsledky odděleně — správně, špatně a žádná odpověď. Tady se většina posouzení pokazí: sloučit „špatně“ a „neznámé“ do jednoho čísla zakryje právě ten rozdíl, na kterém záleží. Neznámé, které lze odfiltrovat, vás bude stát neutrální oslovení. Sebevědomě špatná odpověď vás bude stát zákazníka.
  • 5. Teď nasaďte hranici a spočítejte to znovu. Přijměte jen řádky nad svou hranicí — třeba pravděpodobnost 0,9 s alespoň 50 vzorky za ní — a změřte dvě věci: jakou část souboru to pokryje a chybovost v jejím rámci. Tato dvojice je skutečná odpověď, protože říká, kolik práce zmizí a kolik rizika s tím přijde.
  • 6. Když už u toho jste, zkontrolujte provozní věci. Jak dlouho trvá 300 řádků. Jak vypadá chybová odpověď, když pošlete nesmysl. Zda tentýž dotaz dvakrát vrátí tutéž odpověď. Zda si zkušební provoz vyžádal telefonát.

Pátý krok je důvod, proč na podobě odpovědi záleží víc než na jakémkoli čísle z titulku: bez pravděpodobnosti a počtu vzorků není co nasadit jako hranici, takže poctivá odpověď na otázku „kolik z tohoto souboru můžu zautomatizovat?“ je „celý, nebo nic“. 100 bezplatných dotazů za měsíc pokryje test na 300 řádcích třikrát.

Pokud zvažujete i jazykový model

Krátký seznam dnes čím dál častěji netvoří dvě API, ale jedno API a jeden prompt. To srovnání stojí na jiných věcech — nákladech na milion řádků, zda stejný vstup dá dvakrát stejný výstup a co můžete předložit auditorovi — takže má svou vlastní stránku.

Jak integrace ve skutečnosti vypadá

Vyplatí se na to podívat během posouzení, ne až po něm, protože právě tady se z odpoledne stanou dva týdny. Jeden kredit na dotaz, 100 jmen na jeden dávkový požadavek a žádný strop na počet požadavků.

Ceny začínají na €0.35 za 1 000 dotazů a jsou v plném rozsahu na stránce s cenami — k jejich zobrazení není potřeba poptávka.

Často kladené otázky

Podle čeho porovnávat API na určení pohlaví?

Podle toho, co vám dá jediný výsledek, nikoli podle procenta přesnosti v titulku. Poskytovatel, který vrací pouhý štítek, vás nutí buď věřit každému řádku, nebo každý řádek zkontrolovat; ten, který vrací pravděpodobnost a počet záznamů za ní, vám umožní automatizovat jisté řádky a podívat se jen na zbytek. Potom: zda stejné jméno může být vyhodnoceno různě podle země, zda je odpověď v čase stabilní, co se stane, když jméno není známé, a kde se data zpracovávají.

Jak ho pořádně otestovat?

Na vlastním seznamu, ne na vzorku slavných jmen. Vezměte několik set řádků, u kterých už odpověď znáte — včetně těch nepříjemných — a nechte je projít. 100 bezplatných dotazů za měsíc na to stačí a každý poskytovatel, který stojí za posouzení, vám umožní totéž bez telefonátu.

Je větší databáze jmen lepší?

Sama o sobě ne. Jméno se do součtu počítá, ať už k němu databáze má tři záznamy, nebo padesát tisíc — součet vám tedy neřekne, na kterých vašich řádcích můžete stavět. Podklady u jednotlivého výsledku ano. Velikost rozhoduje o tom, jak často vůbec dostanete odpověď; počet vzorků rozhoduje o tom, zda ji máte použít.

Jakou přesnost zveřejňujete?

Záměrně žádnou měřenou hodnotu. Neprovedli jsme zveřejněné srovnávací měření na označené sadě jmen, takže uvést procento by bylo marketing, ne důkaz. Místo toho vám dáváme podklady u každé odpovědi — pravděpodobnost a počet vzorků u každého výsledku — abyste si přesnost změřili na vlastních datech; to je jediné číslo, které popisuje váš případ. Pokud vám poskytovatel uvede jediné procento přesnosti, zeptejte se, na kterých jménech ho měřil.

Záleží na tom, kde se data zpracovávají?

Záleží, pokud je váš seznam tvořen jmény zákazníků, protože to jsou osobní údaje. Jsme německá společnost, všechny servery stojí v Německu, zpracování probíhá v EU a smlouvu o zpracování osobních údajů si můžete vyžádat ve svém účtu. Ať posuzujete kohokoli, žádejte to písemně před pilotem, ne po něm.

Na které otázky se lidé zapomínají zeptat?

Na tři. Co se stane se jménem, které databáze nezná — prázdné pole, které lze odfiltrovat, má větší cenu než věrohodný odhad, který nerozpoznáte. Zda stejný dotaz vrátí příští rok stejnou odpověď, na čemž záleží ve chvíli, kdy se audit ptá, jak byl záznam klasifikován. A zda nevyužitá kapacita propadá.

OTESTUJTE TO NA SVÉM VLASTNÍM SEZNAMU

100 bezplatných dotazů za měsíc, bez platební karty a bez telefonátu. Přineste řádky, u kterých už odpověď znáte — včetně těch nepříjemných — a podívejte se, co se u každého z nich vrátí.

Chat