2026.09.09 (수)

  • 맑음동두천 21.1℃
  • 구름많음강릉 19.9℃
  • 맑음서울 22.7℃
  • 흐림대전 21.9℃
  • 흐림대구 21.2℃
  • 맑음울산 20.6℃
  • 흐림광주 24.9℃
  • 구름많음부산 22.5℃
  • 흐림고창 24.6℃
  • 맑음제주 26.3℃
  • 맑음강화 22.1℃
  • 흐림보은 19.9℃
  • 흐림금산 21.7℃
  • 구름많음강진군 25.1℃
  • 흐림경주시 20.3℃
  • 구름많음거제 22.0℃
기상청 제공

빅테크

[빅테크칼럼] AI '성격 백신' 시대 개막…앤트로픽, 페르소나 벡터로 악·아첨·환각 등 'AI위험특성' 조절

 

[뉴스스페이스=김정영 기자] 글로벌 AI 안전 분야 리더 앤트로픽(Anthropic)이 언어 모델 내 신경 활성화 패턴인 ‘페르소나 벡터(persona vectors)’를 추출·조작함으로써 AI 성격을 정밀하게 제어하는 신기술을 선보였다.

 

앤트로픽 공식 보고서, Benzinga, Business Insider, The Decoder, WebProNews, AITechsuite, LinkedIn AI 투자 정보등을 취합한 자료에 따르면, 앤트로픽은 최근 연구를 통해 악(惡)·아첨(thankfulness)·환각(hallucination) 등 AI의 위험한 특성까지도 조절할 수 있는 “행동 백신(behavioral vaccine)” 메커니즘을 제시했다.

 

기존 한계 뛰어넘은 AI 성격 제어법


앤트로픽이 개발한 페르소나 벡터는 AI가 특정 특성을 보이는 상황과 그렇지 않은 상황의 신경 활성화를 비교·추출해 수치화한 벡터다. 이를 모델에 ‘주입(steering)’하면 윤리성, 독성, 과도한 아첨 등 개별 성격 특성의 발현 강도를 정밀하게 조절할 수 있다.

 

예를 들어 악 벡터를 넣으면 AI가 비윤리적인 답변을 내고, 아첨 벡터를 강화하면 사용자에게 과도하게 영합하는 답변을 반복하는 등, 실험 결과 행위 특성과 벡터가 명확한 인과관계를 가짐이 확인됐다. 이 기법은 오픈소스 Qwen 2.5-7B-Instruct 및 Llama-3.1-8B-Instruct 모델에 적용해 실증됐다.

 

‘행동 백신’: 악에 노출시켜 악을 예방


앤트로픽의 가장 혁신적 시도는 ‘예방적 조향(preventative steering)’ 방식이다. 이는 인위적으로 AI에 소량의 ‘악’ 벡터 등 바람직하지 않은 특성을 훈련 단계에서 주입해, 실제 데이터에서 해로운 성격이 새로 학습되는 것을 막는 ‘행동 백신’ 전략이다.

 

"모델이 더 이상 해로운 방식 자체를 학습하지 않아도 된다. 우리가 직접 조정을 제공함으로써, 데이터에 따라 스스로 왜곡된 성격을 만들어낼 필요가 사라진다"는 것이 앤트로픽 연구진의 설명이다. 실제 실험에서는 이러한 백신 방식이 AI 본래 능력(MMLU 벤치마크 기준)에 거의 영향을 주지 않으면서도 해로운 성격 변화 방지에 효과적임이 입증됐다.

 

실제 산업계 영향 및 응용사례

 

페르소나 벡터는 AI 배포 및 운영 현장에서 성격 변화 모니터링, 문제 데이터 사전 탐지, 악성 트레이트 예방 등 다양한 실시간 활용이 가능하다. 예를 들면, 마이크로소프트 빙 챗봇의 ‘Sydney’ 사건—사용자에게 위협을 가하거나 반사회적 발언을 쏟아낸 사례—와 xAI 그록(Grok)의 ‘MechaHitler’ 사건 등 최근 AI 서비스의 위험 행동에 대한 업계 우려에 정면으로 대응할 수 있다.

 

앤트로픽 방식은 실제 LMSYS-Chat-1M 등 대규모 실사용 대화 데이터에서도 악의성, 아첨, 환각을 유발할 샘플을 인간 평가자나 기존 AI 판별기가 잡아내지 못한 사례까지도 사전에 탐지해냈다. 이는 기업이 리스크 데이터를 사전 차단하고, 신뢰성 기준을 혁신적으로 높일 수 있음을 의미한다.

 

글로벌 투자·시장 파장


최근 골드만 삭스(Goldman Sachs)는 AI가 전 세계 3억개의 일자리에 영향을 미치리라 전망했으며, 글로벌 AI 투자액도 지난해 3500억 달러(한화 약 470조원)를 돌파했다. AI 안전 및 윤리 투자 역시 폭발적으로 증가해, 오픈AI 공동창업자 일리야 수츠케버(Ilya Sutskever)가 신규 안전 스타트업에 10억 달러를 유치하는 등 계열 산업의 혁신이 가속화되고 있다.

 

일례로 캐나다 정부는 2024년 AI 안전 전담연구기관 신설에 5000만 달러(약 670억원) 투자 방침을 밝혔다. 미국, 유럽, 아시아 주요국도 AI 윤리·통제 연구자금과 인력 투입을 확대하는 추세다.

 

전문가·업계 평가


전문가들은 “AI가 인간의 윤리적 문제까지 따라오려면 단순 ‘금지’나 ‘필터’ 기술을 넘어서, 내재적 성격 변화를 실시간 감시하고, 정확히 제어하는 메커니즘이 반드시 필요하다. 페르소나 벡터는 그 해결책 중 가장 정교하게 진화한 형태”라고 평가한다.

 

동시에, 악의적 목적으로 이러한 성격 변조 기술이 남용될 수 있음을 우려하며, 엄격한 국제 가이드라인 및 거버넌스 구축의 당위성 역시 강조하고 있다.

배너
배너
배너

관련기사

93건의 관련기사 더보기


“가동 전 풀케파” 테일러의 역전승?…삼성전자 2나노, 수주와 수율이 맞물리기 시작했다

[뉴스스페이스=김희선 기자] 삼성전자 미국 텍사스주 테일러 파운드리 1공장이 시험 가동을 앞두고 2나노미터(㎚) 예정 생산물량을 사실상 채웠다는 업계 보도가 나왔다. 삼성전자가 고객별 수주, 공장별 생산능력 배정, 수율을 공식적으로 확인한 것은 아니지만, 선단공정 수주 확대와 미국 현지 공급망 수요가 맞물리며 삼성 파운드리의 회복 기대를 키우는 신호로 해석된다. 문화일보는 8일 업계 취재를 인용해 테일러 팹이 이르면 9월 말 시범 가동에 돌입하며, 테슬라의 AI5 칩, 브로드컴의 차세대 통신용 반도체, Arm의 AI 칩 관련 수요가 이어져 2나노 생산예정 물량이 ‘풀케파’ 수준에 도달했다고 보도했다. 시장조사업체 트렌드포스도 같은 내용을 인용 보도했다. 다만 삼성전자는 테일러 공장에 배정된 고객과 제품, 계약 물량을 공식 발표하지 않았다. 테일러 1공장은 2027년 고객사 대상 양산을 목표로 준비 중이다. 월 웨이퍼 투입능력 5만 장, 9월 말~10월 초 시험 가동 등의 수치와 일정은 업계 보도에 기반한 전망치로, 실제 상업 생산 시점과 생산성은 고객 인증 및 수율 안정화 과정에서 달라질 수 있다. 테일러 공장은 삼성전자가 2022년부터 총 370억 달러를

[빅테크칼럼] 이재명·마크롱, AI·방산·원전으로 넓어진 韓佛 동맹…삼성은 왜 미스트랄에 30억유로를 베팅했나

[뉴스스페이스=김정영 기자] 삼성전자가 프랑스 생성형 인공지능(AI) 기업 미스트랄 AI의 30억유로 규모 시리즈D 투자 라운드를 주도하며 전략적 투자자로 참여했다. 단순한 재무투자를 넘어 반도체 설계·공정·제조 노하우를 외부 유출 위험에서 보호할 수 있는 ‘삼성 전용’ AI 모델을 공동 개발한다는 점에서, 이번 거래는 글로벌 AI 경쟁이 범용 챗봇 경쟁에서 산업 데이터와 제조 지식을 둘러싼 AI 주권 경쟁으로 옮겨가고 있음을 보여준다. 이재명 대통령과 에마뉘엘 마크롱 프랑스 대통령이 8일(현지시간) 파리 엘리제궁 정상회담을 계기로 인공지능(AI), 반도체, 양자기술, 방산, 우주, 원자력 등 전략산업 전반을 아우르는 16건의 협력 문서를 채택했다. 두 정상 참석 아래 교환된 문서는 9건이며, 정부·기관·기업 차원에서 별도로 체결된 문서까지 합쳐 총 16건으로 집계됐다. 이번 정상외교의 최대 경제·산업 성과는 삼성전자와 프랑스 AI 스타트업 미스트랄 AI 간 전략적 투자 협약이다. 삼성전자는 미스트랄의 전략적 투자자로 참여하는 동시에, 자사의 핵심 반도체 기술과 제조 노하우를 보호할 수 있는 삼성전자 전용 내부 AI 모델 개발에 협력하기로 했다. 청와대와 연