Gender API
Registrati gratuitamente
Lingua expand_more

Gender-API vs. ChatGPT: chi deve determinare il genere di un nome?

Entrambi possono dirti che Sandra è di solito femminile. Solo uno dei due può dirti come lo sa, darti la stessa risposta l'anno prossimo e quotare un milione di nomi prima che tu inizi.

Ultima revisione 2026-09-01 Scritto e aggiornato dal team di Gender-API.com

La risposta breve

  • Usa un LLM quando ti serve un giudizio su una manciata di nomi, o del testo da leggere: una spiegazione, un'origine, una formula di saluto.
  • Usa una banca dati di nomi quando la risposta deve essere identica domani, deve arrivare con delle prove, deve avere un prezzo per record, oppure deve resistere a una domanda del responsabile della protezione dei dati.
  • Sui grandi volumi non decide la precisione, ma la tracciabilità. 9,124,598 nomi distribuiti su 192 paesi, ogni risposta con il proprio numero di campioni, contro una generazione che non può mostrare il proprio ragionamento.
  • I due si combinano bene. Dai al modello l'API come strumento — pubblichiamo un server MCP ospitato per questo — e l'etichetta arriva dai dati mentre la formulazione arriva dal modello.
Una domanda — Andrea è maschile o femminile in Germania — con due risposte. La risposta di Gender-API contiene gender female, probability 0.85, samples 464 e country DE, e resta identica a ogni nuova chiamata. La risposta del modello linguistico contiene solo l'etichetta female, e varia con il prompt, la temperature e la versione del modello.
La stessa domanda, e le due risposte una accanto all'altra.

Cosa sono davvero queste due cose

Gender-API.com è un servizio di ricerca su una banca dati di nomi. 9,124,598 nomi, suddivisi per il paese in cui sono stati osservati, 192 paesi supportati. Invii un nome e ricevi un genere, una probabilità e il numero di campioni su cui si basa la risposta. Nulla viene generato.

ChatGPT — come ogni altro modello linguistico generalista — è un generatore di testo. Sa che « Sandra » compare in contesti femminili perché così si comportava la parola nel suo testo di addestramento. È un segnale davvero utile, e con i nomi comuni produce l'etichetta giusta. Ma nell'architettura non c'è nulla che memorizzi quante Sandra fossero femminili in Portogallo: quindi non c'è nulla da citare, nulla su cui fissare una soglia, nulla da verificare.

Questo singolo fatto strutturale spiega tutte le differenze pratiche che seguono.

A CONFRONTO

Le differenze che restano valide qualunque modello scelga.

Cosa ti serve Gender-API.com LLM generalista
La stessa risposta per lo stesso input, ogni volta Sì: è una ricerca su banca dati No: campionamento, formulazione del prompt e versione del modello la spostano
Le prove dietro una singola risposta Numero di campioni e probabilità per risultato e per paese Nessuna; un valore di confidenza, se lo chiedi, è a sua volta generato
Una copertura che puoi garantire per iscritto 9,124,598 nomi, 192 paesi Sconosciuta e non dichiarata
Risposte specifiche per paese Un parametro di paese, locale o IP cambia il risultato Solo se lo indichi nel prompt, e resta comunque una supposizione
Il comportamento fra dodici mesi Lo stesso contratto di endpoint, pubblicato come OpenAPI; v1 e v2 sono entrambe ancora attive I modelli vengono deprecati e sostituiti; le risposte si spostano con loro
Elaborazione in batch 100 nomi per richiesta, o un CSV fino a 10 milioni di righe Limiti di contesto, suddivisione in blocchi, rate limit e nuovi tentativi che scrivi tu
Unità di costo Un credit per ricerca, da un pacchetto acquistato in anticipo Token in ingresso e in uscita: variano con la lunghezza del prompt e i nuovi tentativi
Dove vengono trattati i dati Server in Germania, trattamento all'interno dell'UE, DPA su richiesta Dipende dal fornitore, dal piano e dalla regione che ti viene assegnata
Separare un nome completo, ricavare un nome da un indirizzo e-mail Endpoint dedicati Prompt engineering, e nei casi limite fallisce senza dirlo
Un nome per cui nessuno ha dati Lo dice: result_found è false, oppure la probabilità è bassa Risponde comunque, con lo stesso tono sicuro
Spiegare un nome, la sua origine o le sue varianti Non è ciò per cui è fatto Davvero migliore: è per questo che esiste un modello linguistico

Quanto costa determinare il genere di un milione di nomi?

Qui trovi il metodo invece di un numero di marketing, così puoi rifare il conto con le tariffe di oggi.

Con un'API: Una ricerca vale un credit. La nostra migliore tariffa a volume pubblicata corrisponde a circa €0.35 per 1.000 nomi, quindi un milione di nomi costa attorno a €349 netti: un importo fisso, noto prima di iniziare, su fattura con IVA. I credit dei pacchetti una tantum non scadono.

Con un LLM: Paghi a token, in entrambe le direzioni, per ogni richiesta e ogni nuovo tentativo. Raggruppare più nomi in un solo prompt abbassa il costo per nome, ma reinvii le istruzioni con ogni gruppo, i nomi lunghi e le scritture inusuali costano più token di quelli brevi, e una risposta malformata ti costa anche il nuovo tentativo. Il risultato è una stima, non un numero che puoi mettere in un budget.

Per essere onesti: per qualche migliaio di nomi un modello generalista costa così poco che nulla di tutto questo conta. Il punto di svolta arriva con i volumi, e prima di quanto suggerisca il prezzo dei token, perché tutto il lavoro di sviluppo attorno al raggruppamento, ai nuovi tentativi e alla validazione dell'output è lavoro che con un endpoint di ricerca non devi fare.

Vedi i prezzi per volume

Riproducibilità: il punto che di solito decide

Elabora due volte una lista clienti, ottieni due risultati diversi e ti ritrovi con un problema che non sai spiegare: quale esecuzione era giusta, cosa è cambiato, e cosa dici alla persona a cui il mese scorso hai scritto « Signor » e questo mese « Signora ».

Una ricerca è deterministica. Lo stesso nome con lo stesso paese restituisce lo stesso genere, la stessa probabilità e lo stesso numero di campioni. Quando i dati sottostanti crescono, il numero di campioni cresce con loro — in modo visibile, nella risposta — così un cambiamento è qualcosa che puoi indicare e non qualcosa che è semplicemente accaduto.

Una risposta generata non offre questa garanzia. La temperature, una nuova versione del modello, un prompt di sistema riscritto, un aggiustamento di sicurezza di cui nessuno ti ha parlato: ognuno può ribaltare un nome incerto, e nessuno lascia traccia nei tuoi dati.

Lo stesso nome con lo stesso paese, interrogato a gennaio, giugno e dicembre, restituisce ogni volta female con probability 0.85 e 464 samples. La risposta generata restituisce female, poi male, poi female: tra giugno e dicembre una versione del modello è stata sostituita, e nulla nei dati registra il cambiamento.
A titolo illustrativo. Lo stesso input, tre esecuzioni, un anno.

Ogni risposta porta con sé le proprie prove

Una singola richiesta all'endpoint v2:

POST https://gender-api.com/v2/gender/by-first-name
{ "first_name": "Sandra" }
{
    "input":  { "first_name": "Sandra" },
    "details": {
        "credits_used": 1,
        "samples": 464,
        "country": null,
        "first_name_sanitized": "sandra",
        "duration": "436ms"
    },
    "result_found": true,
    "first_name": "Sandra",
    "probability": 0.85,
    "gender": "female"
}

Due campi fanno il lavoro che nessuna risposta generata offre. « samples » indica su quante osservazioni si basa la risposta, e « probability » la quota di queste che erano femminili. Insieme ti permettono di fissare la tua soglia — accettare i risultati sopra 0.9 con un numero di campioni decente e mandare il resto alla revisione manuale — invece di accettare un unico livello di confidenza per tutta la tua banca dati.

Riferimento completo: la documentazione dell'API v2.

Lo stesso nome non ha lo stesso genere in ogni paese

Andrea è prevalentemente maschile in Italia e prevalentemente femminile in Germania. Jean è maschile in Francia e in larga parte femminile nei paesi anglofoni. Nikita è maschile in Russia e altrove di solito femminile. Non sono casi limite esotici: sono nomi comuni in normali liste clienti.

Se interroghi un modello generalista senza indicare il paese, ottieni la lettura che prevaleva nel suo testo di addestramento, in pratica quella anglofona. L'API prende il paese in modo esplicito:

Due richieste API identiche per il nome Andrea, che differiscono solo nel campo country. Country IT restituisce male, country DE restituisce female. Un prompt senza paese restituisce la lettura che prevaleva nel testo di addestramento.
Due richieste identiche, un campo di differenza, risposte opposte.

Una locale (en_US) o l'indirizzo IP del visitatore funzionano allo stesso modo, e per la domanda inversa c'è un endpoint dedicato: da quale paese viene un nome.

GDPR, e dove finiscono davvero i nomi che invii

I nomi di clienti reali sono dati personali, quindi questa è una questione da ufficio acquisti e non una nota a piè di pagina. Quello che possiamo dire chiaramente:

  • Siamo un'azienda tedesca; tutti i nostri server si trovano in Germania e i dati vengono trattati all'interno dell'UE.
  • Un accordo sul trattamento dei dati si può richiedere dal tuo account.
  • I log del server contengono il nome inviato e vengono conservati 14 giorni, per motivi contabili.
  • I file CSV ed Excel caricati sono archiviati cifrati ed eliminati dopo dieci giorni.
  • Ogni acquisto genera una regolare fattura con IVA, e le partite IVA UE vengono gestite correttamente.

Se un determinato fornitore di modelli sia accettabile per gli stessi dati è una domanda per il tuo responsabile della protezione dei dati — ma è una domanda più lunga, e da rifare ogni volta che il fornitore cambia un sub-responsabile. Le nostre risposte sono nella panoramica sulla privacy.

Quando ChatGPT è la scelta migliore

Questa pagina non varrebbe la lettura se la risposta fosse sempre « compra l'API ». Non lo è:

  • Un lavoro una volta sola. Quaranta nomi in un foglio di calcolo, nessuna pipeline, nessuno lo rifarà mai.
  • Vuoi il ragionamento, non l'etichetta: l'origine di un nome, le sue varianti, come viene normalmente abbreviato, come rivolgersi a qualcuno con cortesia in una data cultura.
  • Nomi che nessuna banca dati ha: coniazioni nuove, personaggi di fantasia, traslitterazioni che non esistono in nessun registro. Un modello farà un'ipotesi ragionevole dove una ricerca semplicemente non ha nulla.
  • Quello che ti serve in uscita è testo libero, non un campo: una riga di saluto invece di una colonna di genere.

Non è generosità, li usiamo allo stesso modo: le descrizioni sull'origine dei nomi sulle nostre pagine sono generate da un modello linguistico, perché il testo è proprio ciò in cui un modello linguistico è bravo.

La soluzione migliore è entrambi: lascia che il modello chiami l'API

Se stai già costruendo su un LLM, non devi scegliere. I modelli moderni chiamano strumenti, e una ricerca di genere è uno strumento ideale: una domanda circoscritta con una risposta di fatto per cui il modello non ha dati.

Pubblichiamo un server MCP ospitato così che qualsiasi assistente o agente compatibile con MCP possa interrogare direttamente la banca dati. I suoi tool sono query_first_name, query_full_name, query_email, get_country_of_origin e get_statistics.

Per le tue definizioni di tool ci sono client ufficiali per nove linguaggi (PHP, Python, Node, Java, Go, Ruby, Rust, Perl, .NET), una descrizione OpenAPI e, all'indirizzo /skill.md, una guida all'implementazione pronta da passare così com'è a un assistente di codice.

È proprio questa divisione dei compiti che conta: il modello decide cosa fare, la banca dati decide cosa è vero.

Domande frequenti

ChatGPT può determinare il genere di un nome?

Sì, e con i nomi comuni di solito indovina. Quello che non può fare è dirti su quanti record si basa la risposta, garantire due volte la stessa risposta o dare una risposta diversa per lo stesso nome in un altro paese. Inoltre risponde con la stessa sicurezza per nomi che non ha mai visto, ed è proprio questo il tipo di errore che conta sui grandi volumi.

Un'API di genere è più precisa di un LLM?

Per un nome presente in una banca dati di nomi, una ricerca è esatta per costruzione: riporta la distribuzione osservata invece di un'inferenza. Per un nome sconosciuto nessuno dei due approcci è affidabile, ma solo la ricerca lo ammette. La differenza solida non è una singola percentuale di precisione: è che ogni ricerca arriva con un numero di campioni e una probabilità su cui puoi fissare una soglia.

Quanto costa determinare il genere di un milione di nomi?

Con Gender-API una ricerca costa un credit, quindi un milione di nomi è un importo fisso e noto: circa €349 netti alla nostra migliore tariffa a volume pubblicata, su fattura con IVA, concordato prima di iniziare. Con un LLM paghi a token per ogni richiesta e ogni nuovo tentativo, quindi la fattura dipende dalla lunghezza del prompt e si può solo stimare.

Posso usare insieme un LLM e un'API di genere?

Sì, ed è la combinazione migliore. Dai al modello l'API come strumento — pubblichiamo un server MCP ospitato esattamente per questo — e l'etichetta arriva dalla banca dati mentre la formulazione arriva dal modello. Il modello smette di tirare a indovinare su fatti per cui non ha dati.

Lo stesso nome ha lo stesso genere in ogni paese?

No, ed è esattamente qui che un prompt senza paese sbaglia. Andrea è prevalentemente maschile in Italia e prevalentemente femminile in Germania; Jean è maschile in Francia e in larga parte femminile nei paesi anglofoni. L'API accetta un paese, una locale o un indirizzo IP e risponde per quel paese.

Cosa succede con un nome che la banca dati non conosce?

Ottieni result_found: false, oppure una probabilità bassa con pochi campioni. È un segnale su cui puoi agire: manda quei record alla revisione manuale, o ripiega su un modello. Una risposta generativa non ti dà nessun segnale del genere.

Gender-API è conforme al GDPR?

Siamo un'azienda tedesca, tutti i server si trovano in Germania e i dati vengono trattati all'interno dell'UE. Un accordo sul trattamento dei dati si può richiedere dal tuo account. I log delle richieste, che contengono il nome inviato, vengono conservati 14 giorni per motivi contabili; i file CSV ed Excel caricati sono archiviati cifrati ed eliminati dopo dieci giorni.

PROVALO CON I TUOI NOMI

Ogni account include 100 ricerche gratuite al mese: abbastanza per controllare i nomi che un LLM ha sbagliato. Senza carta di credito.

Chat