대량 성별 판별: 1만 개에서 10,000,000 개까지
파일을 올리거나 API를 호출해. 어느 쪽이든 시작 전에 가격을 알 수 있고, 모든 행이 근거와 함께 돌아오고, 네 스프레드시트는 네 스프레드시트로 돌아와.
짧은 답
- CSV 하나에 최대 10,000,000행, Excel 통합 문서 하나에 100,000행, 또는 API 요청당 100개(요청 수 상한 없음).
- 조회 한 번이 credit 하나이고 미리 구매해. 이름 1,000개당 €0.35부터야. 작업 전체 가격을 시작 전에 알 수 있고, VAT 청구서가 나오고, credit은 만료되지 않아.
- 네 통합 문서는 교체되는 게 아니라 돌려받는 거야. 서식, 날짜, 수식, 병합된 셀, 다른 시트가 모두 남아. 새 열은 네 데이터 옆에 끼워져.
- 모든 행이 확률과 표본 수를 갖고 있어서, 확실한 행은 자동으로 받아들이고 나머지만 검토로 보낼 수 있어.
두 가지 방법, 그리고 고르는 법
한 번뿐인 정리와 계속 보강되는 데이터베이스는 다른 일이야. 같은 데이터가 둘 다에 답하지만, 둘에 같은 경로를 쓸 필요는 없어.
| 항목 | 파일 업로드 | API 호출 |
|---|---|---|
| 적합한 경우 | 지금 가지고 있는 목록. CRM 내보내기, 행사 신청 목록, 메일 발송 목록 | 계속 들어오는 이름. 가입, 주문, 가져온 리드 |
| 누가 하나 | 파일을 가진 사람 누구나. 코드 없이. | 처음 한 번만 개발자. 그다음엔 알아서 돌아가 |
| 크기 제한 | CSV당 10,000,000행, Excel 통합 문서당 100,000행 | 요청당 100개, 총량 제한 없음 |
| 받는 결과 | 새 열이 끼워진 같은 파일 | 이름별 JSON. 원하는 곳에 기록 |
| 국가 지정 | 도우미에서 국가 열 지정 | 이름별로 국가, locale 또는 IP 주소 |
| 처리 중 | 처리는 백그라운드에서 계속돼. 끝나면 다운로드 링크가 담긴 이메일이 와 | 동기 방식. 요청 하나에 답 하나 |
| 비용 | 같아. 어느 쪽이든 조회당 credit 하나, 같은 잔액에서. | |
대량 작업의 실제 비용
사용자 수나 월 단위가 아니라 조회 단위로 과금해. 해결된 이름 하나가 credit 하나이고, 파일로 갔든 API로 갔든 같아. 물량이 커지면 단가가 좋아져.
| 이름 | 이를 충족하는 가장 싼 공개 패키지(부가세 별도) |
|---|---|
| 10,000 | €16.99 |
| 100,000 | €99.00 |
| 500,000 | €299 |
| 10,000,000 | 견적을 문의해 |
사기 전에 해둘 만한 두 가지가 있어. 둘 다 지불액을 줄여줘. 하나는 목록에서 중복을 제거하는 것(같은 이름이 두 번이면 credit도 두 개), 다른 하나는 사실 성별이 필요 없는 행을 걷어내는 거야. 보내지 않은 이름은 무료이고, 실제 고객 내보내기에서는 이 두 단계가 파일의 꽤 많은 부분을 덜어내곤 해.
현재 금액, 모든 구간, 구독 방식은 가격 페이지에 있어. 가장 큰 공개 패키지보다 크다면 문의해. 특별한 경우가 아니라 흔한 대화야.
네 스프레드시트는 스프레드시트로 돌아와
이 부분은 보통 엉성하게 처리되니 분명히 말할게. 네 데이터를 빼내서 성별을 붙이고 새 파일을 건네는 게 아니야. 네 통합 문서를 열어 그 안에 새 열을 써넣고 돌려줘.
- 서식, 숫자와 날짜 표시 형식, 수식, 병합된 셀이 보존돼. 날짜는 날짜로 남고, 수식은 여전히 수식이야.
- 여러 시트로 된 통합 문서는 모든 시트를 그대로 유지해. 업로드가 모든 시트를 살펴 데이터가 있는 첫 시트를 고르고, 시트 선택으로 다른 시트로 바꿀 수 있어.
- 머리글 행이 1행일 필요는 없어. 자동으로 찾아내고, 잘못 찾았으면 미리보기에서 올바른 행을 클릭하면 돼.
- 표 위의 자유 서술, C열에서 시작하는 표, 빠지거나 중복된 열 제목. 모두 처리해. 실제 내보내기가 그렇게 생겼으니까.
데이터 옆에 추가되는 열:
| 열 | 내용 |
|---|---|
ga_gender |
판별 결과. 라벨은 네가 정해. male/female/unknown, m/f, 1/2, 혹은 네 CRM이 이미 기대하는 표기 아무거나. |
ga_accuracy |
이 이름에 대해 관측된 분포가 얼마나 한쪽으로 치우쳤는지를 0에서 100 사이의 정수로 표시해. (API는 같은 값을 0과 1 사이의 확률로 돌려줘.) 선택 열이야. |
ga_samples |
그 근거가 되는 관측 수. 선택 열이고, 결과를 검증 가능하게 만드는 열이야. |
ga_first_name |
실제로 해결한 이름. 입력이 전체 이름이나 이메일 주소였을 때 유용해. 선택 열이야. |
업로드 도우미, 단계별로. 파일로 시험해 보기
규모가 커지면 표본 수가 더 중요해지는 이유
이름 열 개면 결과를 눈으로 훑을 수 있어. 백만 개면 못 해. 그래서 질문은 어떤 행을 확인 없이 쓸 것인가로 바뀌어.
모든 행이 확률과 그 근거가 되는 관측 수를 갖고 있으니, 그 선은 네가 직접 그어. 흔한 방식은 표본 수가 충분하고 ga_accuracy 90 이상인 건 받아들이고, 나머지는 사람이 보거나 중립적인 호칭으로 넘기는 거야. 다른 선택지, 즉 누군가 정한 하나의 확신도를 데이터베이스 전체에 적용하는 방식은 대규모로 사람들을 잘못 부르게 되는 길이야.
데이터베이스가 해결하지 못한 이름은 추측으로 채우지 않고 성별 열을 비워둬. 9,124,598개국에 걸친 192개의 이름이 있으니 평범한 목록에서는 작은 비중이지만, 네가 직접 볼 수 있는 비중이야.
목록이 여러 국가에 걸쳐 있으면 그렇게 알려줘. 같은 이름이 어디서나 같은 성별은 아니고, 이건 따로 정리해 뒀어.
코드로 하기
계속 보강하려면 일괄 엔드포인트가 요청당 최대 100개를 받아:
POST https://gender-api.com/v2/gender/by-first-name-multiple
[
{ "first_name": "Sandra", "country": "DE" },
{ "first_name": "Andrea", "country": "IT" }
]
각 항목은 독립적으로 판별돼. 각자의 확률, 표본 수, 국가를 가져. 그래서 일괄 처리는 진짜 일괄 처리이고, 하나의 답을 여러 이름에 적용하는 게 아니야.
- PHP, Python, Node, Java, Go, Ruby, Rust, Perl, .NET용 공식 클라이언트.
- v2 전체 문서, OpenAPI 명세, Postman 컬렉션.
- 작업을 코딩 어시스턴트에 넘기고 싶다면 /skill.md에 그대로 넘길 수 있는 구현 가이드가 있어.
- 스프레드시트나 CRM에서 작업하고 싶어? Excel, Google Sheets, Shopify, HubSpot, Salesforce, Zapier 등을 위한 이미 만들어진 연동이 있어.
구매 부서의 질문
실제 고객 이름 목록은 개인정보야. 그리고 대량 작업은 보통 바로 이런 걸 묻는 사람의 승인이 필요해
- 우리는 독일 회사야. 모든 서버가 독일에 있고 데이터는 EU 안에서 처리돼.
- 업로드한 파일은 암호화되어 저장되고 10일 후 삭제돼. 직접 지우면 더 빨리 사라져.
- 데이터 처리 계약은 계정에서 요청할 수 있어
- 서버 로그에는 전송된 이름이 담기고, 회계상의 이유로 14일 보관돼
- 모든 구매에서 정식 VAT 청구서가 발행되고, EU VAT 번호도 올바르게 처리돼
- 단건 패키지의 credit은 만료되지 않아서, 큰 정리를 한 번만 하려면 구독이 필요 없어.
전체 내용은 개인정보 개요에 있어.
자주 묻는 질문
한 번에 몇 개의 이름을 처리할 수 있어?
CSV 파일 하나에 최대 10,000,000행, Excel 통합 문서 하나에 최대 100,000행, API로는 요청당 100개야. 요청 수에는 상한이 없어. 그보다 크면 파일을 나누거나 API를 반복 호출해.
대량 성별 판별 작업은 얼마야?
조회 한 번이 credit 하나라서 가격은 시작 전에 정해져. 50만 개를 커버하는 가장 싼 공개 패키지는 €299(부가세 별도)야. 가장 큰 공개 패키지를 넘어가면 정가가 아니라 견적이 돼. credit은 미리 사고, 만료되지 않고, 구매마다 VAT 청구서가 나와.
개발자가 필요해?
아니야. 파일을 올리고, 이름이 들어 있는 열을 지정하고, 완성된 파일을 내려받으면 끝이야. 코드는 한 줄도 없어. API는 보강이 한 번이 아니라 계속 일어나야 하는 경우를 위한 거야.
내 Excel 파일이 그대로 돌아와?
그래. 서식, 숫자와 날짜 표시 형식, 수식, 병합된 셀, 다른 모든 시트가 원래대로 남아. 네 데이터로 새 파일을 만드는 게 아니라, 새 열을 네 통합 문서 안에 써넣어.
데이터베이스가 해결하지 못한 행은 어떻게 돼?
성별 열은 비어 있고, 표본 수가 그 이유를 알려줘. 빈칸을 채우려고 추측하는 일은 전혀 없어. 그래서 그 행들을 걸러내고 직접 판단할 수 있어. 나중에 추측을 발견하는 일이 없지.
대량 업로드가 GDPR을 지켜?
우리는 독일 회사이고, 모든 서버가 독일에 있고 데이터는 EU 안에서 처리돼. 업로드한 파일은 암호화되어 저장되고 10일 후 삭제되며, 데이터 처리 계약은 계정에서 요청할 수 있어.
결제 전에 시험해 볼 수 있어?
그래. 모든 계정에 매월 무료 조회 100회가 포함돼. 파일 전체에 쓸 credit을 사기 전에 네 목록의 표본을 돌려 결과를 확인하기엔 충분해.
네 목록의 표본부터 시작하기
매월 무료 조회 100회, 신용카드 없이. 실제 파일의 일부를 돌려 결과를 확인하고 나서 전체를 결제하면 돼.