Gender API
Registrera dig gratis
Språk expand_more

Gender-API vs. ChatGPT: vad ska avgöra könet på ett namn?

Båda kan berätta att Sandra oftast är feminint. Bara en av dem kan berätta hur den vet det, ge dig samma svar nästa år och prissätta en miljon namn innan du börjar.

Senast granskad 2026-09-01 Skriven och underhållen av teamet på Gender-API.com

Det korta svaret

  • Ta en LLM när du behöver en bedömning av en handfull namn, eller text som går att läsa: en förklaring, ett ursprung, en hälsningsfras.
  • Ta en namndatabas när svaret måste vara identiskt i morgon, måste komma med underlag, måste ha ett pris per post, eller måste hålla för en fråga från dataskyddsombudet.
  • I stor skala avgörs det inte av träffsäkerhet utan av spårbarhet. 9,124,598 förnamn spridda över 192 länder, varje svar med sitt eget antal urval — mot en generering som inte kan visa hur den kom fram till svaret.
  • De kombineras bra. Ge modellen API:et som verktyg — vi publicerar en hostad MCP-server för det — då kommer etiketten från datan och formuleringen från modellen.
En fråga — är Andrea maskulint eller feminint i Tyskland — besvarad två gånger. Svaret från Gender-API innehåller gender female, probability 0.85, samples 464 och country DE, och är identiskt vid varje nytt anrop. Språkmodellens svar innehåller bara etiketten female och varierar med prompt, temperature och modellversion.
Samma fråga, och de två svaren sida vid sida.

Vad de två sakerna faktiskt är

Gender-API.com är en uppslagstjänst över en namndatabas. 9,124,598 förnamn, uppdelade efter det land de observerades i, 192 länder stöds. Du skickar ett namn och får tillbaka ett kön, en sannolikhet och antalet urval som svaret vilar på. Ingenting genereras.

ChatGPT — och varje annan allmän språkmodell — är en textgenerator. Den vet att ”Sandra” förekommer i feminina sammanhang eftersom ordet betedde sig så i träningstexten. Det är en verkligt användbar signal, och för vanliga namn ger den rätt etikett. Men det finns inget i arkitekturen som lagrar hur många Sandror i Portugal som var kvinnor, så det finns inget att citera, inget att sätta en gräns på och inget att granska.

Detta enda strukturella faktum förklarar alla praktiska skillnader nedan.

SIDA VID SIDA

Skillnaderna som består oavsett vilken modell du väljer.

Vad du behöver Gender-API.com Allmän LLM
Samma svar på samma indata, varje gång Ja — det är en databasuppslagning Nej — sampling, promptens formulering och modellversion flyttar det
Underlaget bakom ett enskilt svar Antal urval och sannolikhet per resultat och per land Inget; ett säkerhetstal är, om du ber om det, självt genererat
Täckning du kan ange skriftligt 9,124,598 namn, 192 länder Okänd och inte angiven
Landsspecifika svar En parameter för land, locale eller IP ändrar resultatet Bara om du säger det i prompten — och det är fortfarande en gissning
Beteendet om tolv månader Samma endpoint-kontrakt, publicerat som OpenAPI; v1 och v2 lever båda kvar Modeller fasas ut och ersätts; svaren flyttar sig med dem
Massbearbetning 100 namn per anrop, eller en CSV med upp till 10 miljoner rader Kontextgränser, uppdelning, rate limits och nya försök skriver du själv
Kostnadsenhet En credit per uppslagning, ur ett paket du köpt i förväg Token in och ut — varierar med promptens längd och nya försök
Var datan behandlas Servrar i Tyskland, behandling inom EU, DPA på begäran Beror på leverantören, planen och den region du får
Dela upp ett fullständigt namn, läsa ut ett namn ur en e-postadress Egna endpoints Prompt engineering — och i gränsfall misslyckas det utan att säga till
Ett namn som ingen har data om Säger det — result_found är false, eller sannolikheten är låg Svarar ändå, i samma självsäkra ton
Förklara ett namn, dess ursprung eller dess varianter Inte vad det är till för Verkligt bättre — det är precis vad en språkmodell är till för

Vad kostar det att avgöra könet på en miljon namn?

Här är räknemetoden i stället för en marknadsföringssiffra, så att du kan göra om den med dagens priser.

Med ett API: En uppslagning är en credit. Vårt bästa publicerade volympris landar på omkring €0.35 per 1 000 namn, så en miljon namn kostar ungefär €349 netto — ett fast belopp, känt innan du börjar, på en faktura med moms. Credits från engångspaket blir inte ogiltiga.

Med en LLM: Du betalar per token, i båda riktningarna, för varje anrop och varje nytt försök. Att bunta ihop flera namn i en prompt sänker kostnaden per namn, men du skickar instruktionerna igen med varje bunt, långa namn och ovanliga skriftsystem kostar fler token än korta, och ett felaktigt formaterat svar kostar dig även det nya försöket. Resultatet är en uppskattning, inte en siffra du kan lägga i en budget.

För att vara rättvis: för några tusen namn är en allmän modell så billig att inget av detta spelar roll. Brytpunkten kommer med volymen — och tidigare än tokenpriset antyder, eftersom allt utvecklingsarbete kring buntning, nya försök och validering av utdata är arbete du inte behöver göra mot en uppslags-endpoint.

Se volympriser

Reproducerbarhet: den punkt som oftast avgör

Kör en kundlista två gånger, få två olika resultat, och du sitter med ett problem du inte kan förklara: vilken körning hade rätt, vad ändrades, och vad säger du till personen som förra månaden tilltalades med ”herr” och den här månaden med ”fru”.

En uppslagning är deterministisk. Samma namn med samma land ger samma kön, samma sannolikhet och samma antal urval. När den underliggande datan växer växer antalet urval med den — synligt, i svaret — så en förändring är något du kan peka på snarare än något som bara hände.

Ett genererat svar ger ingen sådan garanti. Temperature, en ny modellversion, en omskriven systemprompt, en säkerhetsjustering ingen berättade om: var och en kan vända ett gränsfall, och ingen av dem lämnar ett spår i din data.

Samma namn med samma land, uppslaget i januari, juni och december, ger varje gång female med probability 0.85 och 464 samples. Det genererade svaret ger female, sedan male, sedan female — mellan juni och december byttes en modellversion ut, och ingenting i datan noterar den förändringen.
Illustrativt. Samma indata, tre körningar, ett år.

Varje svar bär sitt eget underlag

Ett enda anrop till v2-endpointen:

POST https://gender-api.com/v2/gender/by-first-name
{ "first_name": "Sandra" }
{
    "input":  { "first_name": "Sandra" },
    "details": {
        "credits_used": 1,
        "samples": 464,
        "country": null,
        "first_name_sanitized": "sandra",
        "duration": "436ms"
    },
    "result_found": true,
    "first_name": "Sandra",
    "probability": 0.85,
    "gender": "female"
}

Två fält gör jobbet som inget genererat svar erbjuder. ”samples” är hur många observationer svaret vilar på, och ”probability” är hur stor andel av dem som var kvinnor. Tillsammans låter de dig sätta din egen gräns — godta resultat över 0.9 med ett hyggligt antal urval och skicka resten till manuell granskning — i stället för att godta en enda säkerhetsnivå för hela din databas.

Fullständig referens: dokumentationen för API v2.

Samma namn är inte samma kön överallt

Andrea är övervägande maskulint i Italien och övervägande feminint i Tyskland. Jean är maskulint i Frankrike och till stor del feminint i engelskspråkiga länder. Nikita är maskulint i Ryssland och oftast feminint på andra håll. Det här är inga exotiska gränsfall — det är vanliga namn i vanliga kundlistor.

Fråga en allmän modell utan att nämna land och du får den tolkning som dominerade i träningstexten, vilket i praktiken betyder den engelskspråkiga. API:et tar landet uttryckligen:

Två identiska API-anrop för förnamnet Andrea, som bara skiljer sig i fältet country. Country IT ger male, country DE ger female. En prompt utan angivet land ger den tolkning som dominerade i träningstexten.
Två identiska anrop, ett fält isär, motsatta svar.

En locale (en_US) eller besökarens IP-adress fungerar lika bra, och för den omvända frågan finns en egen endpoint — vilket land ett namn kommer från.

GDPR, och vart namnen du skickar faktiskt tar vägen

Förnamn på verkliga kunder är personuppgifter, så det här är en inköpsfråga och ingen fotnot. Vad vi kan säga rakt ut:

  • Vi är ett tyskt företag; alla våra servrar står i Tyskland och datan behandlas inom EU.
  • Ett personuppgiftsbiträdesavtal kan begäras i ditt konto.
  • Serverloggar innehåller det inskickade namnet och sparas i 14 dagar, av bokföringsskäl.
  • Uppladdade CSV- och Excel-filer lagras krypterat och tas bort efter tio dagar.
  • Varje köp ger en korrekt faktura med moms, och EU-momsnummer hanteras rätt.

Om en viss modelleverantör är godtagbar för samma data är en fråga för ditt dataskyddsombud — men en längre fråga, och en du måste ställa på nytt varje gång leverantören byter underbiträde. Våra svar finns i integritetsöversikten.

När ChatGPT är det bättre valet

Den här sidan vore inte värd att läsa om svaret alltid var ”köp API:et”. Det är det inte:

  • Ett engångsjobb. Fyrtio namn i ett kalkylblad, ingen pipeline, ingen kommer någonsin att köra om det.
  • Du vill ha resonemanget, inte etiketten: ett namns ursprung, dess varianter, hur det normalt förkortas, hur man artigt tilltalar någon i en viss kultur.
  • Namn som ingen databas har: nybildningar, fiktiva figurer, transkriberingar som inte finns i något register. En modell gör en rimlig gissning där en uppslagning helt enkelt inte har något.
  • Det du behöver som utdata är fri text, inte ett fält: en hälsningsrad snarare än en könskolumn.

Det är inte generositet, vi använder dem på samma sätt: beskrivningarna av namnens ursprung på våra egna namnsidor genereras av en språkmodell, eftersom text är precis vad en språkmodell är bra på.

Bäst är båda: låt modellen anropa API:et

Bygger du redan på en LLM behöver du inte välja. Moderna modeller anropar verktyg, och en könsuppslagning är ett idealiskt verktyg: en smal fråga med ett faktasvar som modellen inte har data för.

Vi publicerar en hostad MCP-server så att vilken MCP-kapabel assistent eller agent som helst kan fråga databasen direkt. Dess verktyg är query_first_name, query_full_name, query_email, get_country_of_origin och get_statistics.

För dina egna verktygsdefinitioner finns officiella klienter för nio språk (PHP, Python, Node, Java, Go, Ruby, Rust, Perl, .NET), en OpenAPI-beskrivning och på /skill.md en färdig implementationsguide som du kan ge direkt till en kodassistent.

Just den arbetsfördelningen är poängen: modellen bestämmer vad som ska göras, databasen bestämmer vad som är sant.

Vanliga frågor

Kan ChatGPT avgöra könet på ett namn?

Ja, och för vanliga förnamn har den oftast rätt. Vad den inte kan: berätta hur många poster svaret vilar på, garantera samma svar två gånger, eller ge ett annat svar för samma namn i ett annat land. Den svarar också lika självsäkert på namn den aldrig har sett, och det är precis det felet som spelar roll i stor skala.

Är ett köns-API mer träffsäkert än en LLM?

För ett namn som finns i en namndatabas är en uppslagning korrekt redan genom sin konstruktion: den rapporterar den observerade fördelningen i stället för en slutledning. För ett okänt namn går ingen av metoderna att lita på, men bara uppslagningen erkänner det. Den pålitliga skillnaden är inte en enda träffsäkerhetsprocent — det är att varje uppslagning kommer med ett antal urval och en sannolikhet som du kan sätta en gräns på.

Vad kostar det att avgöra könet på en miljon namn?

Hos Gender-API kostar en uppslagning en credit, så en miljon namn är ett fast, känt belopp — omkring €349 netto till vårt bästa publicerade volympris, på en faktura med moms, bestämt innan du börjar. Med en LLM betalar du per token för varje anrop och varje nytt försök, så räkningen beror på promptens längd och kan bara uppskattas.

Kan jag använda en LLM och ett köns-API tillsammans?

Ja, och det är den bästa uppsättningen. Ge modellen API:et som verktyg — vi publicerar en hostad MCP-server just för detta — då kommer etiketten från databasen och formuleringen från modellen. Modellen slutar gissa om fakta den inte har data för.

Har samma namn samma kön i alla länder?

Nej, och det är precis här en prompt utan land går fel. Andrea är övervägande maskulint i Italien och övervägande feminint i Tyskland; Jean är maskulint i Frankrike och till stor del feminint i engelskspråkiga länder. API:et tar ett land, en locale eller en IP-adress och svarar för det landet.

Vad händer med ett namn som databasen inte känner till?

Du får result_found: false, eller en låg sannolikhet med få urval. Det är en signal du kan agera på: skicka de posterna till manuell granskning, eller falla tillbaka på en modell. Ett generativt svar ger dig ingen sådan signal.

Följer Gender-API GDPR?

Vi är ett tyskt företag, alla servrar står i Tyskland och datan behandlas inom EU. Ett personuppgiftsbiträdesavtal kan begäras i ditt konto. Anropsloggar, som innehåller det inskickade namnet, sparas i 14 dagar av bokföringsskäl; uppladdade CSV- och Excel-filer lagras krypterat och tas bort efter tio dagar.

TESTA PÅ DINA EGNA NAMN

Varje konto innehåller 100 gratis uppslagningar per månad — nog för att kontrollera de namn en LLM hade fel om. Inget kreditkort.

Chatt