10장

누구의 목소리로 만들어졌는가

데이터 대표성과 보이지 않는 노동

핵심 정리

이 AI의 대답에는 고향이 있다 — 많이 적힌 언어, 많이 적은 사람들의 세계다. 같은 기술이 기록에 적게 담긴 사람의 문턱을 치워 주기도 한다. 격차를 벌리는 것도 좁히는 것도 기술 자체가 아니라, 무엇을 담고 누구에게 닿게 하느냐의 문제다.

이 장의 본문은 책에서 읽을 수 있습니다.

출간 이후 달라진 것

책이 나온 뒤 바뀐 사실, 새 통계, 실제 사례의 후속 소식을 저자가 적습니다.

아직 이 장에 덧붙인 내용이 없습니다.

참고 자료

부록 8에 밝힌 이 장의 출처입니다. 주소가 있는 자료는 바로 열 수 있습니다.

  1. 개인정보보호위원회, 「AI 챗봇 ‘이루다’ 관련 조사 결과 발표」, 정책브리핑, 2021-04-28 · 원문 열기 (새 창)
  2. 테크브루, 「AI 챗봇 ‘이루다’ 개인정보 무단 학습 사건, 4년 만에 첫 법적 배상 판결」, 2025-07-18 (1심 판결, 항소 진행)
  3. 타임(Time), 「OpenAI Used Kenyan Workers on Less Than $2 Per Hour…」, 2023-01 (중앙일보 2023-06-05, 지디넷코리아 2023-01-20, 오마이뉴스 2024-04-28 재보도).
  4. Common Crawl, ‘Statistics of Common Crawl Monthly Archives: Distribution of Languages’ (CC-MAIN-2023-50 기준 영어 44.42%, 독일어 5.44%) · 원문 열기 (새 창)
  5. Touvron et al., ‘Llama 2: Open Foundation and Fine-Tuned Chat Models’, arXiv:2307.09288, 2023 (영어 89.70%, 한국어 0.06%)
  6. Yang et al., ‘Qwen2 Technical Report’, arXiv:2407.10671, 2024 (한국어를 포함한 약 30개 언어 지원) · 원문 열기 (새 창)
  7. DeepSeek-AI et al., ‘DeepSeek-V3 Technical Report’, arXiv:2412.19437, 2024 (14조 8천억 개 토큰 학습, 언어별 비율 미공개) · 원문 열기 (새 창)
  8. LG AI Research, ‘EXAONE 3.0 7.8B Instruction Tuned Language Model’, arXiv:2408.03541, 2024 (한국어·영어 이중언어 모델, 언어별 비율 미공개) · 원문 열기 (새 창)
  9. 과학기술정보통신부·한국지능정보사회진흥원, 「2024 디지털 정보격차 실태조사」, 2025-03 (고령층 정보화 수준 71.4%. 접근 96.5%·역량 65.6%는 취약계층 전체 부문별 수치).