नाम से राष्ट्रीयता: नाम क्या बता सकता है और क्या नहीं
एक API कॉल किसी नाम या उपनाम को उन देशों की क्रमबद्ध सूची में बदल देती है जहाँ से वह आता है, हर एक पर एक संभावना के साथ। यह नाम के बारे में एक सवाल का जवाब देती है — जो इस सवाल से अलग है कि व्यक्ति कहाँ रहता है, और इस सवाल से तो और भी अलग कि वह कौन है
छोटा जवाब
- तुम्हें 25 देशों तक की क्रमबद्ध सूची मिलती है, हर एक के साथ एक संभावना, एक ISO कोड, देश का नाम और, जहाँ देश के लिए दर्ज हों, उसका महाद्वीपीय और सांख्यिकीय क्षेत्र
- उसी उत्तर में लिंग, उद्गम भाषा, नाम का अर्थ और जातीय समूहों में उसका वितरण भी होता है, 192 देशों को समेटने वाले डेटाबेस से
- हर नाम पर 2 credits लगते हैं — सामान्य लिंग क्वेरी से दोगुना, क्योंकि यह भारी क्वेरी है। credits पहले से खरीदे जाते हैं और खत्म नहीं होते
- यह नाम के बारे में एक आँकड़ा है, व्यक्ति के बारे में दावा नहीं। इसे संबोधन, समुच्चय विश्लेषण और डेटा गुणवत्ता के लिए इस्तेमाल करो — किसी एक व्यक्ति के बारे में कुछ तय करने के लिए नहीं
यह संख्या कहाँ से आती है?
यहाँ कोई मॉडल अंदाज़ा नहीं लगाता, और कुछ भी पैदा नहीं किया जाता। संभावना उन रिकॉर्डों पर की गई गणित है जो हमारे पास वाकई हैं — इसीलिए वही नाम आज, अगले महीने और अगले साल वही सूची लौटाता है
दो संकेत भीतर जाते हैं। पहला यह कि उस नाम के रिकॉर्ड देशों में कैसे फैले हैं — जो नाम हमारे पास ज़्यादातर पोलैंड से है, वह पोलिश की ओर झुकता है। दूसरा यह कि उन आबादियों में से हर एक कितनी बड़ी है, जो अच्छे नमूने वाले नाम रखने वाले छोटे देश को केवल मात्रा के बल पर बड़े देश से आगे निकलने से रोकता है। दोनों का देश के हिसाब से औसत लिया जाता है, एक प्रतिशत से नीचे का सब हटा दिया जाता है, और जो बचता है उसे क्रम में लगाया जाता है
क्योंकि यह एक वितरण है, दो देशों में आम नाम एक विजेता चुनने के बजाय दो देशों के साथ जवाब देता है। काम की बात यही है: सूची का आकार तुम्हें बताता है कि पहली प्रविष्टि पर कितना भरोसा किया जाए
क्या वापस आता है
एक POST, एक नाम, एक उत्तर। नीचे की सूची छोटी की गई है; असली सूची सबसे संभावित 25 देशों तक जाती है
POST https://gender-api.com/v2/country-of-origin
{ "first_name": "Johann" }
{
"result_found": true,
"first_name": "Johann",
"gender": "male",
"probability": 0.9,
"language_of_origin": "Germanic",
"meaning": "…",
"country_of_origin": [
{
"country_name": "Germany",
"country": "DE",
"probability": 0.52,
"continental_region": "Europe",
"statistical_region": "Western Europe"
},
{
"country_name": "Austria",
"country": "AT",
"probability": 0.48,
"continental_region": "Europe",
"statistical_region": "Western Europe"
}
],
"ethnicity": {
"id": "GERMANIC",
"name": "Germanic (German, Austrian, Swiss)",
"distribution": [ … ]
},
"details": { "credits_used": 2, "samples": 890, "duration": "414ms" }
}
उन दो फ़ील्ड पर ध्यान दो जो उत्तर को जाँचने योग्य बनाती हैं: samples बताता है कि उत्तर कितने रिकॉर्ड पर टिका है, और credits_used दो credits की पुष्टि करता है। कम नमूनों वाला उत्तर तुमसे छिपाया नहीं जाता
- continental_region और statistical_region से तुम अपनी मैपिंग बनाए रखे बिना सूची को क्षेत्र के स्तर पर समेट सकते हो
- उत्तर में उस नाम के इंटरैक्टिव नक्शे का लिंक भी होता है — किसी नतीजे को आँख से जाँचने का सबसे तेज़ तरीका
- हर फ़ील्ड v2 संदर्भ में दर्ज है
उद्गम निवास नहीं है
यह सबसे आम गलतफहमी है, और दोनों तरफ होती है। दो अलग फ़ील्ड, दो अलग अर्थ, उलटी दिशाएँ
| सवाल | जो देश तुम भेजते हो | जो देश तुम्हें वापस मिलता है |
|---|---|---|
| क्षेत्र | country, locale, ip |
country_of_origin |
| अर्थ | व्यक्ति अभी कहाँ है | नाम कहाँ से आया है |
| लिंग का जवाब बदलता है | हाँ — Andrea इटली में पुरुष नाम है और जर्मनी में स्त्री नाम | नहीं — यह आउटपुट है, इनपुट नहीं |
| आम तौर पर तुम्हें यह पहले से पता होता है | हाँ — डिलीवरी पते, डोमेन या IP से | नहीं — तुम जो खरीद रहे हो वह ठीक यही है |
| Credits | मुफ़्त — एक पैरामीटर, क्वेरी नहीं | हर नाम पर 2 |
यह क्या नहीं है
नाम नाम के बारे में सबूत है। उसे व्यक्ति के बारे में सबूत मानना ही वह जगह है जहाँ इस तरह का डेटा बिगड़ता है, इसलिए उस पर कुछ बनाने से पहले सीमाओं के बारे में साफ़-साफ़ कह देना ठीक रहता है
Nguyen नाम का व्यक्ति मेलबर्न में जन्मा हो सकता है, और Smith नाम के व्यक्ति ने कभी किसी अंग्रेज़ी-भाषी देश में पैर न रखा हो। एंडपॉइंट “यह नाम कहाँ से आया है” का जवाब देता है, और यही एक सवाल है जिसका वह जवाब देता है
- यह न राष्ट्रीयता है, न नागरिकता, न जन्मस्थान — और इनमें से किसी का सबूत भी नहीं
- यह व्यक्ति की जातीयता नहीं है। जातीय वितरण बताता है कि नाम समूहों में कैसे फैला है — यह नाम का गुण है
- इससे किसी एक व्यक्ति के बारे में कुछ तय नहीं होना चाहिए — न कोई कीमत, न कोई आवेदन, न कोई जोखिम अंक। जातीय उद्गम की ओर इशारा करने वाला डेटा GDPR के अनुच्छेद 9 के तहत विशेष श्रेणी है, और वह फैसला नियंत्रक के रूप में तुम्हारा है, हमारा नहीं
- यह अंदाज़ा नहीं है। जहाँ हमारे पास बहुत कम है, वहाँ result_found false होता है और नमूनों की संख्या यह कह देती है — फ़ील्ड भरने के लिए कोई मुनासिब-सा देश गढ़ा नहीं जाता
हमारी तरफ़: हम एक जर्मन कंपनी हैं, सारे सर्वर जर्मनी में हैं, डेटा EU के भीतर संसाधित होता है, और डेटा प्रोसेसिंग समझौता तुम अपने खाते में मँगवा सकते हो। पूरी तस्वीर गोपनीयता अवलोकन पर है
लोग इसे असल में किस काम में लाते हैं
- संबोधन सही करना। यह जानना कि कोई नाम जर्मन नहीं बल्कि इतालवी है, “Andrea” को गलत अभिवादन से सही अभिवादन में बदल देता है — और उसी उत्तर में मौजूद लिंग क्वेरी वह हिस्सा है जो इस पर अमल करता है
- समुच्चय स्तर पर बाज़ार और दर्शक विश्लेषण। किसी अभियान का अनुवाद किस भाषा में करें, कोई मेलिंग सूची असल में किन क्षेत्रों तक पहुँचती है, ग्राहक आधार कहाँ बढ़ा है
- डेटा गुणवत्ता। जिस सूची में उद्गम वितरण का आकार अचानक बदल जाए, उसका आम तौर पर मतलब है कि कोई इंपोर्ट बिगड़ा — यह नहीं कि दर्शक कहीं और चले गए
- शोध और जनसांख्यिकी, जहाँ पूरे समूह पर नाम-स्तरीय वितरण विश्लेषण की इकाई है और किसी व्यक्ति के बारे में कोई निष्कर्ष नहीं निकाला जाता
- लिप्यंतरण और मिलान, जहाँ किसी नाम का संभावित उद्गम जानने से उसकी मुमकिन वर्तनियाँ सीमित हो जाती हैं
पूरी सूची पर चलाना
बैच रूप हर अनुरोध में 100 नाम तक लेता है, अनुरोधों की संख्या पर कोई सीमा नहीं। payload एक सादा JSON सरणी है
POST https://gender-api.com/v2/country-of-origin
[
{ "first_name": "Johann" },
{ "full_name": "Andrea Rossi" }
]
- नाम की जगह पूरा नाम या ई-मेल पता भी चलता है — पहले नाम निकाला जाता है, फिर उद्गम तय होता है
- PHP, Python, Node, Java, Go, Ruby, Rust, Perl और .NET के लिए आधिकारिक क्लाइंट।
- इंटीग्रेशन के बजाय एक बार की सूची के लिए थोक लिंग क्वेरी देखो — वही credits, कोई कोड नहीं
- हर फ़ील्ड, हर त्रुटि और एक OpenAPI विवरण: v2 संदर्भ
अक्सर पूछे जाने वाले सवाल
क्या तुम किसी के नाम से उसकी राष्ट्रीयता बता सकते हो?
नहीं, और कोई भी ईमानदार सेवा यह नहीं कर सकती। तुम्हें मिलता है यह कि नाम कहाँ और कितनी मज़बूती से मिलता है, देश के हिसाब से क्रम में — नाम के बारे में एक आँकड़ा, उसे धारण करने वाले व्यक्ति के बारे में तथ्य नहीं। बहुत लोग ऐसा नाम रखते हैं जिसका उद्गम उनके जन्मस्थान से कोई मेल नहीं खाता
एंडपॉइंट क्या लौटाता है?
25 देशों तक की क्रमबद्ध सूची, हर एक के साथ एक संभावना, एक ISO देश कोड, देश का नाम और — जहाँ देश के लिए दर्ज हों — उसका महाद्वीपीय और सांख्यिकीय क्षेत्र। उसी उत्तर में लिंग, उद्गम भाषा, नाम का अर्थ और जातीय समूहों में उसका वितरण भी होता है
संभावना कैसे निकाली जाती है?
दो संकेतों से: उस नाम के लिए हमारे पास मौजूद रिकॉर्ड का कितना हिस्सा किस देश से आता है, और उन आबादियों में से हर एक कितनी बड़ी है। दोनों का देश के हिसाब से औसत लिया जाता है, एक प्रतिशत या उससे कम वाले देश हटा दिए जाते हैं, और बाकी को क्रम में लगाया जाता है। हर मान अकेले उस देश का अंक नहीं बल्कि पूरे का हिस्सा है — इसलिए उन्हें एक-दूसरे के सापेक्ष पढ़ो। वे ठीक 1 नहीं बनेंगे: एक प्रतिशत से नीचे का सब कुछ बाहर रह जाता है, और पच्चीसवें देश के बाद का भी
उद्गम देश की एक क्वेरी का खर्च क्या है?
हर नाम पर दो credits, क्योंकि यह सामान्य लिंग क्वेरी से भारी क्वेरी है। credits 1,000 पर €0.35 से शुरू होते हैं, पहले से खरीदे जाते हैं, और खत्म नहीं होते
क्या यह उसी country पैरामीटर जैसा है जो मैं भेजता हूँ?
नहीं — ये उलटी दिशाएँ हैं। तुम जो country, locale या ip भेजते हो, वह बताता है कि व्यक्ति अभी कहाँ है, और बदल देता है कि कौन-सा लिंग लौटेगा। जो उद्गम देश तुम्हें वापस मिलता है, वह बताता है कि नाम कहाँ से आया है और इस पर निर्भर नहीं करता कि व्यक्ति कहाँ रहता है
क्या मैं इसमें पूरी सूची चला सकता हूँ?
हाँ। बैच वाला रूप हर अनुरोध में 100 नाम तक लेता है, अनुरोधों की संख्या पर कोई सीमा नहीं, और वही एंडपॉइंट एक नाम का जवाब भी उतनी ही अच्छी तरह देता है
क्या नाम से उद्गम का अनुमान लगाना GDPR के तहत वैध है?
यह इस पर निर्भर करता है कि तुम उसका क्या करते हो, और यह नियंत्रक के रूप में तुम्हारा फैसला है, हमारा नहीं। जातीय उद्गम की ओर इशारा करने वाला डेटा अनुच्छेद 9 के तहत एक विशेष श्रेणी है, इसलिए उसे किसी व्यक्ति विशेष के बारे में फैसले लेने में इस्तेमाल करने के लिए ऐसा कानूनी आधार चाहिए जो तुम दिखा सको। समुच्चय विश्लेषण और सही संबोधन आम उपयोग हैं। हम एक जर्मन कंपनी हैं, सारे सर्वर जर्मनी में हैं, और डेटा प्रोसेसिंग समझौता तुम अपने खाते में मँगवा सकते हो
उन नामों पर आज़माओ जो तुम पहले से जानते हो
हर महीने 100 मुफ़्त क्वेरी, कोई क्रेडिट कार्ड नहीं। उन नामों से शुरू करो जिनका उद्गम तुम खुद जाँच सकते हो — वितरण क्या कह रहा है, यह देखने का सबसे तेज़ तरीका यही है