2026.09.05 (토)

  • 맑음동두천 26.8℃
  • 흐림강릉 24.3℃
  • 맑음서울 28.3℃
  • 맑음대전 28.3℃
  • 구름많음대구 26.0℃
  • 맑음울산 25.1℃
  • 맑음광주 29.6℃
  • 맑음부산 27.6℃
  • 맑음고창 29.0℃
  • 맑음제주 28.4℃
  • 구름많음강화 26.4℃
  • 맑음보은 26.0℃
  • 흐림금산 26.5℃
  • 맑음강진군 29.7℃
  • 구름많음경주시 24.3℃
  • 맑음거제 27.1℃
기상청 제공

빅테크

[빅테크칼럼] AI 이미지의 ‘출처’가 사라진다…MIT가 던진 저작권 소송의 새 변수

 

[뉴스스페이스=김정영 기자] MIT 연구진이 대규모 확산형 이미지 생성 모델에서 특정 학습 이미지와 생성 결과 사이의 인과관계를 입증하기가 사실상 불가능해질 수 있다는 결과를 내놨다. 이는 AI 기업에 자동 면책을 주는 발견이 아니라, 저작권 소송의 쟁점을 ‘학습 여부’에서 ‘실질적 복제와 출력 단계의 인과성’으로 옮길 수 있는 기술적 근거다.

 

데이터가 클수록 희미해지는 개별 이미지의 흔적

 

MIT News, theregister, zmescience, aifeed, blogspan, xenospectrum에 따르면, MIT 컴퓨터과학·인공지능연구소(CSAIL)의 Zheng Dai와 David Gifford 연구진은 Nature Communications에 공개한 연구에서 ‘저작권 귀속 소멸(attribution decay)’ 현상을 제시했다. 생성 모델이 더 많은 이미지로 학습될수록, 특정 결과물에 대해 개별 학습 이미지 한 장이 미친 영향을 찾아내기 어려워지고, 일정 규모를 넘으면 그 영향 자체가 측정되지 않을 수 있다는 내용이다.

 

연구진은 단일 거대 모델을 매번 다시 훈련하는 대신, 데이터셋의 서로 겹치는 부분집합으로 학습한 여러 구성 요소를 결합하는 ‘디퓨전 앙상블(diffusion ensemble)’ 구조를 설계했다. 특정 이미지의 영향을 확인할 때는 그 이미지를 학습한 구성 요소를 제외해, 해당 이미지가 학습에 없었을 경우의 결과물인 반사실적 출력(counterfactual output)을 만들었다. 이는 기존의 영향도 추정 기법과 달리, 특정 데이터의 학습 영향을 실제로 제거하는 방식이라는 점에서 차별화된다.

 

실험 규모도 적지 않다. 연구진은 CIFAR-10, CelebA, MetFaces, ArtBench 등 7개 공개 이미지 컬렉션을 활용해 총 24개 앙상블을 구축했고, 학습 데이터 규모는 256장부터 16만 장 이상까지 확대했다. 그 결과 데이터셋이 커질수록 원래 출력과 특정 데이터를 배제한 출력 사이의 최대 차이인 ‘반사실 반경(counterfactual radius)’이 역멱법칙(inverse power law)에 따라 줄어드는 경향이 확인됐다. 픽셀 단위와 의미론적 유사성 등 복수 지표에서도 같은 흐름이 관찰됐다고 MIT는 설명했다.

 

특히 연구진은 소규모 조건에서 1,282개의 모델을 별도로 재학습하는 방식으로도 결과를 검증했다. 데이터 제거 방식 자체가 결과를 왜곡했을 가능성을 점검하기 위해서다. 제거 비율을 고정하거나, 학습 에포크·텍스트 프롬프트·클래스 조건·4개 유사도 지표를 바꿔도 귀속 소멸 패턴은 유지됐다고 연구진은 밝혔다.

 

“학습했다”와 “그 결과를 만들었다”는 다르다


이번 논문의 핵심은 AI 모델이 특정 이미지를 학습 데이터로 보유했다는 사실과, 해당 이미지가 특정 생성물의 원인이라는 주장이 동일하지 않다는 데 있다. Dai 연구원은 특정 데이터를 빼도 결과가 변하지 않는다면 그 데이터가 해당 출력에 영향을 미쳤다고 보기 어렵다는 취지로 설명했다.

 

이 논리는 현재의 AI 저작권 분쟁에서 중요한 구분을 요구한다. 원고가 제기하는 첫 번째 문제는 작품이 무단으로 수집·학습됐는지다. 두 번째는 그 학습이 특정 출력의 실질적 유사성, 복제 또는 2차적 저작물성으로 이어졌는지다. MIT 연구는 후자의 인과관계를 개별 학습 샘플 단위로 입증하는 일이 데이터 규모가 커질수록 어려워질 수 있음을 보여준다.

 

다만 이것이 “대규모 데이터로 학습했으니 침해가 아니다”라는 결론으로 직행하지는 않는다. 연구진도 모델의 암기와 재현이 발생할 수 있음을 명시했다. 특정 이미지가 거의 그대로 출력되거나, 희귀한 작품·워터마크·인물 사진이 반복적으로 재현되는 경우라면, 저작권·퍼블리시티권·개인정보 문제는 여전히 별도로 검토돼야 한다. 논문이 다룬 대상도 이미지 확산 모델이며, 대규모 언어모델(LLM)에 동일한 현상이 성립하는지는 아직 검증되지 않았다.

 

소송의 승부처는 ‘데이터셋 공개’만이 아니다


AI 저작권 소송에서 원고 측은 대체로 학습 데이터 접근, 작품 포함 여부, 출력의 유사성, 모델의 암기 가능성 등을 입증하려 한다. 그러나 이 연구는 데이터셋에서 특정 작가의 작품이 발견됐다는 사실만으로 개별 출력물의 침해적 파생성을 곧바로 설명하기 어렵다는 문제를 부각한다.

 

코넬 로스쿨과 코넬 테크의 James Grimmelmann 교수는 MIT 발표를 통해, 귀속 분석이 제대로 작동한다면 특정 결과물과 저작권 보호 작품의 유사성이 복제 때문인지 우연인지 판별할 수 있어야 하지만, 이번 논문은 “흥미로운 모델”에서는 그러한 귀속이 실패할 수 있다는 근거를 제시한다고 평가했다. 법원과 기술 전문가는 복제 여부를 평가하기 위해 다른 방법을 사용해야 할 것이라는 견해다.

 

즉, 법적 판단은 “그림 한 장이 데이터셋에 있었는가”라는 정적 사실보다, “그림 한 장 또는 특정 창작자의 표현이 어떤 경로로 출력에 실질적으로 재현됐는가”라는 동적 증명에 더 의존할 수 있다.

 

AI 기업에는 방패이자 새로운 의무


이번 연구는 AI 기업에 유리한 면과 부담을 동시에 안긴다. 대형 모델에서 개별 데이터의 출력 기여도가 극히 작거나 측정 불가능하다는 점은 특정 생성 결과를 한 작가나 한 작품에 귀속시키려는 주장에 방어 논리가 될 수 있다. 반면 기업이 이를 방어에 활용하려면 실제 모델이 개별 저작물을 암기·재생산하지 않도록 설계·검증됐다는 것을 보여줘야 한다.

 

Gifford 교수도 기업들이 “인터넷의 개별 항목에 대한 파생물”을 생성하지 않는다고 주장하려면, 그러한 비귀속성을 보장·입증할 수 있는 모델 개선과 검증 역량을 갖춰야 한다는 취지로 강조했다. 단순히 학습 데이터가 많다는 사실만으로는 충분하지 않고, 데이터 거버넌스와 출력 안전성 평가가 결합돼야 한다는 의미다.

 

산업적으로는 세 가지 과제가 선명해진다. 첫째, 기업은 고위험 저작물·유명 작가·인물·상표에 대해 데이터 출처와 삭제 요청을 추적할 수 있는 체계를 갖춰야 한다. 둘째, 모델 출시 전후로 재현성·근접복제·워터마크 생성 여부를 테스트하고 그 결과를 기록해야 한다. 셋째, 소송이나 규제 조사 시 학습 데이터가 출력에 미친 영향을 단순 추정이 아닌 재현 가능한 방식으로 설명할 수 있어야 한다.

 

MIT 연구가 보여준 것은 저작권 문제가 사라진다는 사실이 아니라, AI 시대의 저작권 책임을 계산하는 방식이 더 복잡해졌다는 점이다. 학습 데이터의 무단 이용 문제는 여전히 남지만, 개별 결과물의 책임을 묻는 법정에서는 이제 ‘무엇을 학습했는가’ 못지않게 ‘무엇이 실제 출력의 원인이었는가’가 핵심 질문으로 부상할 전망이다.

배너
배너
배너

관련기사

93건의 관련기사 더보기


[공간사회학] 태국發 데이터센터 49곳 건설중단에 미국·사우디도 브레이크…"‘데이터센터의 역풍" 전기·물·토지 앞에 선 글로벌 규제 물결

[뉴스스페이스=이은주 기자] 인공지능(AI) 확산의 물리적 기반인 데이터센터가 더 이상 ‘투자 유치’만의 대상이 아니라 전력·물·토지·소음·주민 수용성을 동시에 심사받는 대형 기반시설로 재분류되고 있다. malaymail.com, iea.org, spectrumnews, dig.watch에 따르면, 태국이 49개 데이터센터 건설 프로젝트에 일시 중단을 요청하고 117개 계류 사업의 승인도 멈춘 가운데, 미국 지방정부들은 시설 규모와 주거지 이격거리, 냉각방식, 공청회 절차까지 규정하기 시작했다. 사우디아라비아 역시 상업용 데이터센터에 대한 전국 단위의 인허가·건설·운영 표준을 신설했다. 이번 규제 움직임은 개별 지역의 ‘님비(NIMBY)’ 현상에 그치지 않는다. 국제에너지기구(IEA)는 전 세계 데이터센터 전력 소비량이 2024년 약 415테라와트시(TWh), 세계 전력소비의 약 1.5%에서 2030년 약 945TWh로 두 배 이상 늘어나 세계 전력수요의 3%에 육박할 것으로 전망했다. 이는 현재 일본 한 나라의 연간 전력소비량을 웃도는 수준이다. AI 최적화 데이터센터가 이 증가의 핵심 동력으로 지목된다. 태국, ‘49곳 중단’의 의미 태국 국가경제사회개발

[빅테크칼럼] 앤트로픽의 2조 달러 IPO, 독특한 수탁자 지배구조 모델 '시험대'…장기이익신탁이 던진 ‘AI 공익 거버넌스’

[뉴스스페이스=김정영 기자] 앤트로픽(Anthropic)의 상장 추진을 둘러싼 핵심 쟁점은 2조달러라는 초대형 기업가치 그 자체가 아니라, 상장 이후에도 일반 주주보다 강한 영향력을 행사할 수 있는 외부 수탁자 조직, 장기이익신탁(Long-Term Benefit Trust·LTBT)이라는 분석이 나왔다. 회사의 AI 안전·공익 미션을 분기 실적과 주가 압력으로부터 분리하겠다는 장치지만, 공개시장 투자자 입장에서는 의결권과 이사회 통제권의 상당 부분을 포기해야 하는 실험이기도 하다. 앤트로픽의 기업공개(IPO) 추진은 인공지능 산업의 자본조달 기록을 새로 쓸 수 있다는 점에서 주목받지만, 더 근본적인 질문은 따로 있다. 회사의 돈을 대는 상장 주주와 회사를 통제하는 주체가 반드시 같아야 하는가라는 문제다. 파이낸셜타임스(FT)는 9월 4일(현지시간) 앤트로픽의 LTBT가 회사 이사회의 과반을 임명하거나 해임할 수 있는 핵심 지배장치라고 보도했다. 앤트로픽은 델라웨어주 공익법인(Public Benefit Corporation·PBC) 구조를 기반으로 장기이익신탁(LTBT)을 운영한다. 이 신탁은 회사 지분을 보유하지 않고 배당이나 매각차익을 직접 취하지 않으면서

[빅테크칼럼] 스포티파이 창업자의 '네코헬스', 100세 건강에 1조원 베팅…"회복 캡슐이 아니라 조기경보실"

[뉴스스페이스=이종화 기자] 스포티파이 공동창업자 다니엘 에크가 세운 네코헬스(Neko Health)가 주목받고 있다. 이 비즈니스모델은 병원을 새로 짓는 기업이라기보다, 데이터·센서·의료진을 결합해 ‘증상이 생기기 전’ 몸의 이상 신호를 포착하려는 예방의료 플랫폼에 가깝다. 이 사업모델의 비전과 진짜 승부처는 고가 검진의 대중화가 아니라 검진 이후 치료 연결과 건강수명 개선을 입증하는 데 있다. ‘병원’보다 예방의료 플랫폼 스웨덴 스톡홀름에 기반을 둔 네코헬스는 다니엘 에크와 얄마르 닐손네가 공동창업한 예방의료 기술기업이다. 핵심 상품은 전통적인 종합병원 진료나 정밀검사 패키지와는 결이 다르다. 피부·심혈관·혈액·대사 건강을 센서와 현장 혈액분석으로 점검하고, 결과를 같은 방문 안에서 의료진이 설명하는 ‘예방형 건강 스캔’이다. 미국 기준 이용 시간은 1시간, 가격은 499달러다. 영국에서는 299파운드, 스웨덴에서는 2750크로나에 제공되고 있다. 네코헬스는 70개 이상 센서를 활용해 수천만 개의 데이터를 수집한다고 설명한다. 피부는 2000장 이상의 고해상도 이미지로 기록해 점·색소 변화 등을 추적하고, 심전도·심장 기능·동맥 및 미세순환 관련 신호,

[빅테크칼럼] AI 붐이 바꾼 한국사회의 연애와 전공…‘의사·변호사’ 대신 반도체 엔지니어, 의대 대신 전기·컴공

[뉴스스페이스=이종화 기자] 인공지능(AI) 반도체 호황이 한국 증시를 끌어올리는 데 그치지 않고, 결혼시장과 대학 전공 선택까지 재편하고 있다. 삼성전자와 SK하이닉스의 초고속 주가 상승, 수억원대 성과급, 명확한 국내 고용 경로가 맞물리면서 ‘반도체 대기업 엔지니어’는 신흥 혼인 선호 직군이 됐고, 전기·컴퓨터공학은 의학계열 못지않은 선망의 진로로 부상했다. ‘AI 붐’의 숫자 올해 한국 AI 랠리의 중심에는 고대역폭메모리(HBM)를 포함한 고사양 메모리 반도체 수요가 있다. 로이터는 엔비디아 등 AI 칩에 쓰이는 고성능 메모리 수요가 공급을 압도하면서 가격과 실적, 주가를 동시에 밀어 올렸다고 분석했다. 실제로 올해 1분기 메모리 가격은 직전 분기 대비 두 배로 뛰었고, AI 데이터센터 수요로 당분기 추가 상승 폭이 최대 63%에 이를 수 있다는 전망도 제시됐다. 이 흐름 속에서 삼성전자는 5월 6일, SK하이닉스는 5월 27일 각각 시가총액 1조 달러를 넘어섰다. SK하이닉스는 5월 27일 종가 기준 시가총액 1680조원, 약 1조1200억달러를 기록했다. 로이터는 당시 두 회사가 코스피 전체 시가총액의 약 절반을 차지했다고 보도했다. 코스피는 202