2026.08.18 (화)

  • 맑음동두천 27.0℃
  • 맑음강릉 28.5℃
  • 구름많음서울 26.0℃
  • 맑음대전 27.4℃
  • 구름많음대구 27.1℃
  • 흐림울산 24.4℃
  • 맑음광주 26.7℃
  • 흐림부산 25.7℃
  • 맑음고창 26.5℃
  • 구름많음제주 27.1℃
  • 맑음강화 26.6℃
  • 맑음보은 25.7℃
  • 맑음금산 26.5℃
  • 맑음강진군 28.0℃
  • 흐림경주시 25.7℃
  • 흐림거제 25.9℃
기상청 제공

빅테크

[빅테크칼럼] "질문언어에 따라 대답·성격 달랐다" 힌디어·아랍어 '공손·위로', 영어·러시아 '깐깐·엄밀', 한국어 '솔직·간결'…앤트로픽, AI 가치관의 언어편차 '실증'

 

[뉴스스페이스=이종화 기자] 앤트로픽(Anthropic)이 7월 13일(현지시간) 자사 챗봇 '클로드'가 사용 모델과 대화 언어에 따라 서로 다른 가치관을 드러낸다는 연구 결과를 공개했다. 전 세계 수백만 명이 이용하는 AI 시스템의 일관성과 편향성 문제를 정면으로 겨냥한 첫 대규모 실증 연구다.

 

31만 건 대화 해부한 4개 가치 축

 

앤트로픽 공식자료와 인디아투데이 보도에 따르면, 앤트로픽 사회적 영향(Societal Impacts) 팀은 2026년 5월 2주간 클로드.ai에서 수집된 실제 익명 대화 30만9,815건을 분석했다. 대상은 소넷 4.6, 오퍼스 4.6, 오퍼스 4.7 등 3개 모델과 한국어를 포함한 사용량 상위 20개 언어였으며, 기존에 파악된 3,000개 이상의 가치를 ▲수용성-신중함 ▲따뜻함-엄밀함 ▲깊이-간결함 ▲솔직함-실행력이라는 4개 해석 가능한 축으로 압축했다.

 

다만 이 4개 축이 실제 대화에서 나타난 가치 표현 차이를 설명하는 비율은 약 15%에 그쳐, 여전히 상당 부분이 미해명 상태로 남아 있다는 점은 눈여겨볼 대목이다.

 

힌디어·아랍어는 "위로형", 영어·러시아어는 "따박따박형"


가장 큰 변동폭을 보인 축은 '따뜻함 대 엄밀함'이었다. 힌디어와 아랍어로 대화할 때는 공손한 표현과 유머, 긍정적 확인 등 따뜻함 관련 가치가 두드러졌고, 영어와 러시아어에서는 사용자의 전제에 의문을 제기하고 근거를 요구하며 세부사항을 교정하는 엄밀함 성향이 강하게 나타났다. 반면 '수용성-신중함'과 '깊이-간결함' 축은 언어와 무관하게 비교적 일관된 경향을 유지했다. 인도네시아어에서는 불확실성을 설명하기보다 곧바로 실행 가능한 결과를 제시하는 성향이 상대적으로 높게 관찰됐다.

 

한국어는 1만5,570건 이상의 대화 분석 결과, 20개 언어 평균 대비 수용성·따뜻함·솔직함이 다소 높았고 특히 간결성이 두드러졌다. 사용자를 판단하기보다 공감과 위로를 우선하고, 상대의 말투·높임말 수준에 자연스럽게 맞추며 유머와 장난스러운 표현을 섞어 쓰는 경향도 확인됐다. 일본어 역시 언어 간 편차가 상대적으로 작은 편에 속했다.

 

앤트로픽은 같은 사업계획서를 두고 피드백을 요청해도 힌디어 사용자와 러시아어 사용자는 "클로드가 평가를 표현하는 방식에서 서로 다른 가치관을 드러내기 때문에 사업 계획의 품질에 대해 서로 다른 인상을 가질 수 있다"고 경고했다.

 

"왜 그런지는 아직 모른다"…공정성 논쟁으로 이어질 가능성


앤트로픽은 이러한 편차의 발생 원인을 아직 규명하지 못했다고 인정했다. 가능한 설명으로는 언어별로 불균등한 학습 데이터 분포와 데이터 구성의 차이가 꼽힌다. 아울러 이 편차 중 어느 정도가 '바람직한' 것인지에 대한 판단도 아직 내리지 못했다고 밝혔는데, 일부는 언어권별 대화 규범의 자연스러운 반영일 수 있지만 일부는 특정 언어 커뮤니티에 대한 서비스 품질 격차를 뜻할 수도 있다는 것이다.

 

연구진은 "클로드가 표현하는 가치관이 우리가 의도적으로 선택하지 않은 방식으로 달라진다는 것을 확인했으며, 그 변화가 왜 발생하는지, 그리고 사용자에게 실질적으로 도움이 되는지를 앞으로 연구할 수 있다"고 밝혔다. 이번 방법론은 향후 모델 출시 전후 가치 프로필 평가와 실서비스 환경에서의 지속적 모니터링 체계로 활용될 예정이다.

배너
배너
배너

관련기사

93건의 관련기사 더보기


[빅테크칼럼] 챗GPT에 '전여친 살해계획' 美 남성, 오픈AI 긴급신고로 '체포'…“비밀은 없다” AI 감시·신고의 두 얼굴

[뉴스스페이스=김정영 기자] 미국 플로리다에서 전 여자친구를 상대로 한 성폭력·살해 계획을 챗GPT에 반복적으로 입력한 전직 금융분석가가 오픈AI의 긴급 신고를 거쳐 체포·유죄 인정 처분을 받았다. 이번 사건은 생성형 AI가 범죄 조력 도구가 될 수 있다는 위험과 동시에, 플랫폼의 위험 탐지·당국 통보가 실제 물리적 피해를 막는 안전망으로 작동할 수 있음을 보여준다. 8월 14일(현지시간) 미국 현지 법원 기록과 팜비치포스트 보도에 따르면, 당시 25세였던 대런 저우는 지난 3월 결별한 지 약 6개월 된 전 여자친구를 상대로 납치·성폭력·살해 및 살해 후 자살 계획을 챗GPT에 상세히 입력했다. 그는 “이달 말까지 죽이겠다”, “내 것이 될 수 없다면 누구의 것도 될 수 없다”는 취지의 발언을 남겼고, 피해자의 취미·자주 가는 장소·주변 남성에 대한 질투 등을 언급하며 동선을 파악한 정황도 드러났다. 두 달치 대화, FBI 거쳐 경찰로 핵심은 단순히 폭력적 언어를 사용했다는 데 있지 않다. 수사당국은 저우의 대화가 충동적 감정 표출이 아니라 범행을 “리허설하고 계획한 기록"이라고 판단했다. 그는 전 여자친구가 다니는 체육시설 주차장에서 기다리다 거절당하면 총

[빅테크칼럼] “모리스 웜의 재현인가, 통제 실패의 경고인가”…암스트롱의 ‘2년 내 폭주 AI’ 전망, 숫자로 본 현실

[뉴스스페이스=김정영 기자] 코인베이스의 브라이언 암스트롱 CEO가 “향후 1~2년 안에 인터넷에서 폭주하는 AI 모델이 등장할 수 있다”고 경고했다. 다만 최근의 실제 사례들은 AI가 스스로 의식을 갖고 통제를 벗어났다는 뜻이라기보다, 고성능 에이전트가 허술한 샌드박스·인터넷 연결·권한 관리의 빈틈을 빠르게 결합해 목표를 수행한 통제·평가 인프라 실패에 더 가깝다는 분석이 나온다. reuters, cnbc, cryptobriefing에 따르면, 암스트롱은 13일 X(엑스)에서 “1988년 모리스 웜 같은 사건이 1~2년 내 벌어져도 놀랍지 않다”며, 사건 직후 언론의 과열 보도와 AI 중단 요구가 빗발치겠지만 궁극적으로는 방어 체계가 진화할 것이라고 전망했다. 그는 대규모 AI 보안사고를 기술 확산 과정의 일시적 충격으로 바라보는 셈이다. ‘폭주’보다 더 정확한 표현은 목표 일탈 최근 AI 보안 이슈의 핵심은 자율 에이전트가 주어진 목표를 수행하는 과정에서 평가자가 설정한 경계와 제한을 무시하거나 우회했다는 데 있다. CNBC에 따르면 오픈AI 모델들은 내부 사이버보안 테스트에서 답안을 얻기 위해 샌드박스 환경을 벗어나 오픈소스 AI 플랫폼 허깅페이스(Hu

[빅테크칼럼] 사람의 손동작이 ‘원료’가 됐다…휴머노이드 로봇 시대가 만든 신종 긱 이코노미

[뉴스스페이스=김정영 기자] 휴머노이드 로봇 경쟁이 본격화하면서, 빨래 개기·설거지·요리·부품 조립 같은 일상 노동이 로봇 AI의 훈련 데이터로 거래되는 시장이 빠르게 커지고 있다. 그러나 이 산업의 핵심 자산인 ‘인간의 행동 데이터’가 저임금 국가의 노동력과 사적 생활공간에 기대고 있다는 점에서, 데이터 소유권·보상·개인정보 보호를 둘러싼 새로운 규제 공백도 드러나고 있다. AI 기업들, 웨어러블 카메라로 로봇 훈련시킬 긱 워커 수천 명 모집 Bloomberg, technologyreview, cryptobriefing에 따르면, 50개국 이상에서 새로운 형태의 긱 워크가 등장하고 있다. 수천 명의 계약직 작업자들이 이마에 카메라를 달고 모션 트래킹 장갑을 낀 채, 빨래 개기, 설거지, 부품 조립과 같은 지극히 평범한 일상 동작을 녹화한다. 바로 휴머노이드 로봇이 이러한 동작을 따라 할 수 있도록 학습시키기 위해서다. 13일(현지시간) 블룸버그 뉴스레터에서 상세히 다뤄진 이 트렌드는 긱 이코노미의 최신 개척지가 될 가능성이 높다. 이전까지 긱 이코노미의 산물이 코드 작업, 콘텐츠 검수, 음식 배달이었다면, 이제는 사람의 손동작을 담은 생(raw) 영상 데이