[뉴스스페이스=김정영 기자] 개발사와 기술 사양을 공개한 뒤 제품을 출시하던 생성형 인공지능(AI) 시장에 역순의 출시 방식이 확산하고 있다. 모델의 이름과 제작사를 감춘 채 개발자에게 먼저 배포하고, 실제 사용 데이터와 평가가 쌓인 뒤 정체를 공개하는 이른바 ‘스텔스 모델’ 실험이다. 다만 익명성이 브랜드 편견을 걷어내는 장점인 동시에, 누가 민감한 입력 데이터를 보관하고 책임지는지 알기 어렵다는 구조적 위험도 키우고 있다.
OpenRouter, businessinsider, developersdigest, explainx, techtimes에 따르면, AI 모델 중개 플랫폼 오픈라우터(OpenRouter)는 8월 20일(현지시간) 익명 모델 ‘Ox Alpha’를 공개했다. 오픈라우터는 이 모델을 코딩, 장기 에이전트 작업, 실제 서비스 환경을 겨냥한 추론 모델로 소개하면서도 개발·운영 주체는 “익명을 선택한 제3자 공급자”라고만 밝혔다. 오픈라우터는 요청을 전달하는 중개자일 뿐 모델의 개발사·소유자·운영사가 아니라고 명시했다.
Ox Alpha의 명세는 이름값에 비해 상당히 공격적이다. 컨텍스트 창은 정확히 104만8576토큰, 최대 출력은 13만1072토큰이다. 텍스트뿐 아니라 이미지와 비디오를 입력으로 받을 수 있지만, 출력은 텍스트로 한정된다. 도구 호출과 JSON 형식 출력도 지원하며, 공개 당시 API 입·출력 토큰 가격은 모두 0달러로 설정됐다. 오픈라우터가 표시한 최적 공급자 기준 중앙값 성능은 초당 28토큰, 첫 응답을 포함한 전체 지연시간 중앙값은 3.17초다.
무료 대규모 실전시험
익명 모델의 핵심은 제한된 베타테스트보다 훨씬 큰 규모의 ‘현장 검증’이다. 오픈소스 AI 코딩 에이전트 오픈코드(OpenCode)는 Ox Alpha를 약 1주일 동안 사실상 제한 없이 쓸 수 있도록 제공하면서, 공급자가 하루 100조토큰의 처리 용량을 보유하고 있다고 밝혔다. 이는 결제기업 스트라이프 공동창업자 패트릭 콜리슨이 “매우 인상적”이라고 평가할 만큼 빠르게 개발자 커뮤니티의 관심을 끈 배경이다.
100조토큰은 단순한 홍보 수치가 아니다. 대규모 언어모델의 실력은 정답률만으로 가늠하기 어렵다. 긴 코드베이스를 읽고 수정하는 과정, 여러 도구를 연쇄 호출하는 에이전트 업무, 이미지·문서·텍스트가 섞인 입력, 드물게 발생하는 오류와 보안 취약점은 실제 이용 환경에서 더 잘 드러난다. 익명 공개는 개발사가 수많은 사용자의 프롬프트와 결과물을 통해 실험실 벤치마크로 포착하기 어려운 실패 사례를 모으는 방식으로 볼 수 있다.
또한 브랜드를 뗀 시험은 성능 자체에 대한 반응을 끌어내는 장치이기도 하다. 사용자는 ‘오픈AI 모델’, ‘중국 모델’, ‘대형 빅테크 모델’이라는 간판보다 응답 품질, 코드 수정 능력, 속도, 오류 빈도로 모델을 판단하게 된다. 반대로 개발사는 공개 전부터 성능을 둘러싼 추측과 비교 실험을 유도해 막대한 광고비 없이 주목도를 확보한다.
‘익명 알파’의 전례
Ox Alpha는 돌발적인 사례가 아니다. 오픈라우터는 이미 ‘클로크드(cloaked) 모델’, 즉 커뮤니티 피드백을 얻기 위해 정체를 가린 모델을 반복적으로 운영해 왔다.
오픈AI의 Quasar Alpha와 Optimus Alpha는 2025년 4월 14일 정체가 GPT-4.1 대형 모델 시험판으로 공개된 뒤 즉시 종료됐다. 오픈라우터는 GPT-4.1이 일반 출시됐다고 밝히면서 두 알파 모델이 해당 대형 버전의 테스트였다고 설명했다. 정식 GPT-4.1은 104만7576토큰의 컨텍스트를 제공하고, 오픈라우터 기준 API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 8달러다.
Z.ai도 같은 방식을 활용했다. Pony Alpha는 2월 6일 제작사 표시 없이 무료로 등장했고, 컨텍스트 길이는 20만 토큰이었다. 이후 Z.ai는 Pony Alpha가 GLM-5의 스텔스 테스트 버전이었다고 공개했다. 공개 후 GLM-5는 7440억 파라미터급 모델로 소개됐고, OpenRouter를 포함한 여러 플랫폼에 배포됐다. Pony Alpha는 공개 첫날 400억 토큰 이상을 처리한 것으로 집계됐다.
샤오미 사례는 익명 공개가 기업 인식을 어떻게 바꾸는지 보여준다. Hunter Alpha는 3월 11일 오픈라우터에 제작사 표기 없이 등장하면서 DeepSeek의 차기 모델일 수 있다는 추측을 낳았다. 그러나 3월 18일 샤오미 AI팀 미모(MiMo)는 이 모델이 자사의 에이전트용 주력 모델 ‘MiMo-V2-Pro’의 초기 내부 시험 빌드였다고 밝혔다. 로이터는 당시 모델이 복잡한 작업을 더 적은 사람의 지시와 감독으로 수행하도록 설계된 AI 에이전트의 ‘두뇌’를 지향했다고 보도했다.
신뢰의 공백, 데이터의 행방
문제는 익명 시험이 성능만 익명화하는 데 그치지 않고 데이터 책임 주체까지 흐릴 수 있다는 점이다. 오픈라우터의 Ox Alpha 안내문은 공급자가 프롬프트와 생성 결과를 보관하며, 해당 데이터는 훈련에 사용하지 않는다고 적고 있다. 그러나 보관 주체의 회사명, 소재 국가, 보존 기간, 접근 권한, 침해 사고 발생 시 책임 구조는 모델 안내 페이지에서 확인되지 않는다.
여기서 ‘훈련에 쓰지 않는다’와 ‘보관하지 않는다’는 전혀 다른 약속이다. Ox Alpha는 사용자 입력과 출력이 보관된다는 점을 명시한다. 오픈코드 측이 ‘제로 데이터 보존’을 내세운 것과 오픈라우터의 모델별 고지는 표현상 차이가 있으며, 외부 분석에서도 이 불일치가 지적됐다. 스텔스 모델 약관은 이용자가 입력한 개인정보가 공급자에게 전송될 수 있음을 밝히고 있어, 실무자는 모델별 고지뿐 아니라 적용되는 서비스 약관까지 함께 확인해야 한다.
특히 소스코드, 미공개 실적, 거래처 계약서, 신제품 설계도, 고객정보, 보도 전 취재자료를 다루는 기업과 언론사에는 ‘무료’가 보안 검토를 대체할 수 없다. 익명 공급자에게 입력한 데이터가 학습용으로 쓰이지 않는다고 해도, 보관·운영 과정의 관할권과 사고 대응 창구가 불분명하면 내부 통제 기준을 충족하기 어렵다.
의문점만 남은 Ox Alpha의 실체
Ox Alpha의 제작사는 아직 공식 확인되지 않았다. 중국 AI 연구소 모델이라는 관측, Z.ai의 GLM 계열일 수 있다는 추정, 마이크로소프트 MAI 계열일 수 있다는 반론 등이 이어지지만, 이를 뒷받침하는 공식 발표는 없다. 현재 확인 가능한 사실은 익명의 제3자 공급자가 운영하는 무료 프리뷰 모델이라는 점까지다.
스텔스 모델은 AI 출시의 순서를 ‘발표-평가-배포’에서 ‘배포-평가-공개’로 바꾸고 있다. 이 방식은 거대 브랜드의 후광과 후발 기업에 대한 선입견을 동시에 걷어내고, 실제 사용자 환경에서 빠르게 성능을 검증하는 도구가 될 수 있다.
그러나 정체를 감춘 공급자에게 데이터를 맡기는 순간, 기술 실험은 개인정보·영업비밀·책임소재의 문제로 전환된다. AI 업계의 새 문법은 “일단 한번 써봐”이지만, 기업과 개인이 따라야 할 문장은 더 단순하다. “민감한 것은 넣지도 사용하지도 말아야 한다”는 점이다.

































































