Gender-API vs. ChatGPT: chi deve determinare il genere di un nome?
Entrambi possono dirti che Sandra è di solito femminile. Solo uno dei due può dirti come lo sa, darti la stessa risposta l'anno prossimo e quotare un milione di nomi prima che tu inizi.
La risposta breve
- Usa un LLM quando ti serve un giudizio su una manciata di nomi, o del testo da leggere: una spiegazione, un'origine, una formula di saluto.
- Usa una banca dati di nomi quando la risposta deve essere identica domani, deve arrivare con delle prove, deve avere un prezzo per record, oppure deve resistere a una domanda del responsabile della protezione dei dati.
- Sui grandi volumi non decide la precisione, ma la tracciabilità. 9,124,598 nomi distribuiti su 192 paesi, ogni risposta con il proprio numero di campioni, contro una generazione che non può mostrare il proprio ragionamento.
- I due si combinano bene. Dai al modello l'API come strumento — pubblichiamo un server MCP ospitato per questo — e l'etichetta arriva dai dati mentre la formulazione arriva dal modello.
Cosa sono davvero queste due cose
Gender-API.com è un servizio di ricerca su una banca dati di nomi. 9,124,598 nomi, suddivisi per il paese in cui sono stati osservati, 192 paesi supportati. Invii un nome e ricevi un genere, una probabilità e il numero di campioni su cui si basa la risposta. Nulla viene generato.
ChatGPT — come ogni altro modello linguistico generalista — è un generatore di testo. Sa che « Sandra » compare in contesti femminili perché così si comportava la parola nel suo testo di addestramento. È un segnale davvero utile, e con i nomi comuni produce l'etichetta giusta. Ma nell'architettura non c'è nulla che memorizzi quante Sandra fossero femminili in Portogallo: quindi non c'è nulla da citare, nulla su cui fissare una soglia, nulla da verificare.
Questo singolo fatto strutturale spiega tutte le differenze pratiche che seguono.
A CONFRONTO
Le differenze che restano valide qualunque modello scelga.
| Cosa ti serve | Gender-API.com | LLM generalista |
|---|---|---|
| La stessa risposta per lo stesso input, ogni volta | Sì: è una ricerca su banca dati | No: campionamento, formulazione del prompt e versione del modello la spostano |
| Le prove dietro una singola risposta | Numero di campioni e probabilità per risultato e per paese | Nessuna; un valore di confidenza, se lo chiedi, è a sua volta generato |
| Una copertura che puoi garantire per iscritto | 9,124,598 nomi, 192 paesi | Sconosciuta e non dichiarata |
| Risposte specifiche per paese | Un parametro di paese, locale o IP cambia il risultato | Solo se lo indichi nel prompt, e resta comunque una supposizione |
| Il comportamento fra dodici mesi | Lo stesso contratto di endpoint, pubblicato come OpenAPI; v1 e v2 sono entrambe ancora attive | I modelli vengono deprecati e sostituiti; le risposte si spostano con loro |
| Elaborazione in batch | 100 nomi per richiesta, o un CSV fino a 10 milioni di righe | Limiti di contesto, suddivisione in blocchi, rate limit e nuovi tentativi che scrivi tu |
| Unità di costo | Un credit per ricerca, da un pacchetto acquistato in anticipo | Token in ingresso e in uscita: variano con la lunghezza del prompt e i nuovi tentativi |
| Dove vengono trattati i dati | Server in Germania, trattamento all'interno dell'UE, DPA su richiesta | Dipende dal fornitore, dal piano e dalla regione che ti viene assegnata |
| Separare un nome completo, ricavare un nome da un indirizzo e-mail | Endpoint dedicati | Prompt engineering, e nei casi limite fallisce senza dirlo |
| Un nome per cui nessuno ha dati | Lo dice: result_found è false, oppure la probabilità è bassa | Risponde comunque, con lo stesso tono sicuro |
| Spiegare un nome, la sua origine o le sue varianti | Non è ciò per cui è fatto | Davvero migliore: è per questo che esiste un modello linguistico |
Quanto costa determinare il genere di un milione di nomi?
Qui trovi il metodo invece di un numero di marketing, così puoi rifare il conto con le tariffe di oggi.
Con un'API: Una ricerca vale un credit. La nostra migliore tariffa a volume pubblicata corrisponde a circa €0.35 per 1.000 nomi, quindi un milione di nomi costa attorno a €349 netti: un importo fisso, noto prima di iniziare, su fattura con IVA. I credit dei pacchetti una tantum non scadono.
Con un LLM: Paghi a token, in entrambe le direzioni, per ogni richiesta e ogni nuovo tentativo. Raggruppare più nomi in un solo prompt abbassa il costo per nome, ma reinvii le istruzioni con ogni gruppo, i nomi lunghi e le scritture inusuali costano più token di quelli brevi, e una risposta malformata ti costa anche il nuovo tentativo. Il risultato è una stima, non un numero che puoi mettere in un budget.
Per essere onesti: per qualche migliaio di nomi un modello generalista costa così poco che nulla di tutto questo conta. Il punto di svolta arriva con i volumi, e prima di quanto suggerisca il prezzo dei token, perché tutto il lavoro di sviluppo attorno al raggruppamento, ai nuovi tentativi e alla validazione dell'output è lavoro che con un endpoint di ricerca non devi fare.
Riproducibilità: il punto che di solito decide
Elabora due volte una lista clienti, ottieni due risultati diversi e ti ritrovi con un problema che non sai spiegare: quale esecuzione era giusta, cosa è cambiato, e cosa dici alla persona a cui il mese scorso hai scritto « Signor » e questo mese « Signora ».
Una ricerca è deterministica. Lo stesso nome con lo stesso paese restituisce lo stesso genere, la stessa probabilità e lo stesso numero di campioni. Quando i dati sottostanti crescono, il numero di campioni cresce con loro — in modo visibile, nella risposta — così un cambiamento è qualcosa che puoi indicare e non qualcosa che è semplicemente accaduto.
Una risposta generata non offre questa garanzia. La temperature, una nuova versione del modello, un prompt di sistema riscritto, un aggiustamento di sicurezza di cui nessuno ti ha parlato: ognuno può ribaltare un nome incerto, e nessuno lascia traccia nei tuoi dati.
Ogni risposta porta con sé le proprie prove
Una singola richiesta all'endpoint v2:
POST https://gender-api.com/v2/gender/by-first-name
{ "first_name": "Sandra" }
{
"input": { "first_name": "Sandra" },
"details": {
"credits_used": 1,
"samples": 464,
"country": null,
"first_name_sanitized": "sandra",
"duration": "436ms"
},
"result_found": true,
"first_name": "Sandra",
"probability": 0.85,
"gender": "female"
}
Due campi fanno il lavoro che nessuna risposta generata offre. « samples » indica su quante osservazioni si basa la risposta, e « probability » la quota di queste che erano femminili. Insieme ti permettono di fissare la tua soglia — accettare i risultati sopra 0.9 con un numero di campioni decente e mandare il resto alla revisione manuale — invece di accettare un unico livello di confidenza per tutta la tua banca dati.
Riferimento completo: la documentazione dell'API v2.
Lo stesso nome non ha lo stesso genere in ogni paese
Andrea è prevalentemente maschile in Italia e prevalentemente femminile in Germania. Jean è maschile in Francia e in larga parte femminile nei paesi anglofoni. Nikita è maschile in Russia e altrove di solito femminile. Non sono casi limite esotici: sono nomi comuni in normali liste clienti.
Se interroghi un modello generalista senza indicare il paese, ottieni la lettura che prevaleva nel suo testo di addestramento, in pratica quella anglofona. L'API prende il paese in modo esplicito:
Una locale (en_US) o l'indirizzo IP del visitatore funzionano allo stesso modo, e per la domanda inversa c'è un endpoint dedicato: da quale paese viene un nome.
GDPR, e dove finiscono davvero i nomi che invii
I nomi di clienti reali sono dati personali, quindi questa è una questione da ufficio acquisti e non una nota a piè di pagina. Quello che possiamo dire chiaramente:
- Siamo un'azienda tedesca; tutti i nostri server si trovano in Germania e i dati vengono trattati all'interno dell'UE.
- Un accordo sul trattamento dei dati si può richiedere dal tuo account.
- I log del server contengono il nome inviato e vengono conservati 14 giorni, per motivi contabili.
- I file CSV ed Excel caricati sono archiviati cifrati ed eliminati dopo dieci giorni.
- Ogni acquisto genera una regolare fattura con IVA, e le partite IVA UE vengono gestite correttamente.
Se un determinato fornitore di modelli sia accettabile per gli stessi dati è una domanda per il tuo responsabile della protezione dei dati — ma è una domanda più lunga, e da rifare ogni volta che il fornitore cambia un sub-responsabile. Le nostre risposte sono nella panoramica sulla privacy.
Quando ChatGPT è la scelta migliore
Questa pagina non varrebbe la lettura se la risposta fosse sempre « compra l'API ». Non lo è:
- Un lavoro una volta sola. Quaranta nomi in un foglio di calcolo, nessuna pipeline, nessuno lo rifarà mai.
- Vuoi il ragionamento, non l'etichetta: l'origine di un nome, le sue varianti, come viene normalmente abbreviato, come rivolgersi a qualcuno con cortesia in una data cultura.
- Nomi che nessuna banca dati ha: coniazioni nuove, personaggi di fantasia, traslitterazioni che non esistono in nessun registro. Un modello farà un'ipotesi ragionevole dove una ricerca semplicemente non ha nulla.
- Quello che ti serve in uscita è testo libero, non un campo: una riga di saluto invece di una colonna di genere.
Non è generosità, li usiamo allo stesso modo: le descrizioni sull'origine dei nomi sulle nostre pagine sono generate da un modello linguistico, perché il testo è proprio ciò in cui un modello linguistico è bravo.
La soluzione migliore è entrambi: lascia che il modello chiami l'API
Se stai già costruendo su un LLM, non devi scegliere. I modelli moderni chiamano strumenti, e una ricerca di genere è uno strumento ideale: una domanda circoscritta con una risposta di fatto per cui il modello non ha dati.
Pubblichiamo un server MCP ospitato così che qualsiasi assistente o agente compatibile con MCP possa interrogare direttamente la banca dati. I suoi tool sono query_first_name, query_full_name, query_email, get_country_of_origin e get_statistics.
Per le tue definizioni di tool ci sono client ufficiali per nove linguaggi (PHP, Python, Node, Java, Go, Ruby, Rust, Perl, .NET), una descrizione OpenAPI e, all'indirizzo /skill.md, una guida all'implementazione pronta da passare così com'è a un assistente di codice.
È proprio questa divisione dei compiti che conta: il modello decide cosa fare, la banca dati decide cosa è vero.
Domande frequenti
ChatGPT può determinare il genere di un nome?
Sì, e con i nomi comuni di solito indovina. Quello che non può fare è dirti su quanti record si basa la risposta, garantire due volte la stessa risposta o dare una risposta diversa per lo stesso nome in un altro paese. Inoltre risponde con la stessa sicurezza per nomi che non ha mai visto, ed è proprio questo il tipo di errore che conta sui grandi volumi.
Un'API di genere è più precisa di un LLM?
Per un nome presente in una banca dati di nomi, una ricerca è esatta per costruzione: riporta la distribuzione osservata invece di un'inferenza. Per un nome sconosciuto nessuno dei due approcci è affidabile, ma solo la ricerca lo ammette. La differenza solida non è una singola percentuale di precisione: è che ogni ricerca arriva con un numero di campioni e una probabilità su cui puoi fissare una soglia.
Quanto costa determinare il genere di un milione di nomi?
Con Gender-API una ricerca costa un credit, quindi un milione di nomi è un importo fisso e noto: circa €349 netti alla nostra migliore tariffa a volume pubblicata, su fattura con IVA, concordato prima di iniziare. Con un LLM paghi a token per ogni richiesta e ogni nuovo tentativo, quindi la fattura dipende dalla lunghezza del prompt e si può solo stimare.
Posso usare insieme un LLM e un'API di genere?
Sì, ed è la combinazione migliore. Dai al modello l'API come strumento — pubblichiamo un server MCP ospitato esattamente per questo — e l'etichetta arriva dalla banca dati mentre la formulazione arriva dal modello. Il modello smette di tirare a indovinare su fatti per cui non ha dati.
Lo stesso nome ha lo stesso genere in ogni paese?
No, ed è esattamente qui che un prompt senza paese sbaglia. Andrea è prevalentemente maschile in Italia e prevalentemente femminile in Germania; Jean è maschile in Francia e in larga parte femminile nei paesi anglofoni. L'API accetta un paese, una locale o un indirizzo IP e risponde per quel paese.
Cosa succede con un nome che la banca dati non conosce?
Ottieni result_found: false, oppure una probabilità bassa con pochi campioni. È un segnale su cui puoi agire: manda quei record alla revisione manuale, o ripiega su un modello. Una risposta generativa non ti dà nessun segnale del genere.
Gender-API è conforme al GDPR?
Siamo un'azienda tedesca, tutti i server si trovano in Germania e i dati vengono trattati all'interno dell'UE. Un accordo sul trattamento dei dati si può richiedere dal tuo account. I log delle richieste, che contengono il nome inviato, vengono conservati 14 giorni per motivi contabili; i file CSV ed Excel caricati sono archiviati cifrati ed eliminati dopo dieci giorni.
PROVALO CON I TUOI NOMI
Ogni account include 100 ricerche gratuite al mese: abbastanza per controllare i nomi che un LLM ha sbagliato. Senza carta di credito.
Documentazione dell'API · Assegna il genere a un file CSV o Excel · Server MCP