2026.09.13 (일)

  • 구름많음동두천 17.0℃
  • 흐림강릉 18.9℃
  • 흐림서울 19.3℃
  • 맑음대전 17.9℃
  • 맑음대구 18.6℃
  • 맑음울산 19.2℃
  • 맑음광주 20.6℃
  • 흐림부산 23.2℃
  • 맑음고창 17.1℃
  • 맑음제주 22.5℃
  • 흐림강화 17.6℃
  • 맑음보은 14.9℃
  • 맑음금산 15.4℃
  • 맑음강진군 18.9℃
  • 맑음경주시 16.8℃
  • 구름많음거제 21.6℃
기상청 제공

빅테크

[빅테크칼럼] 스페이스XAI "Grok 4.6, GPT-5.6 Sol·Fable 5와 동급 성급·비용 60% 낮다”…장기 에이전트 경쟁의 새 변수

 

[뉴스스페이스=김정영 기자] 스페이스XAI는 8월 12일(현지시간) Grok 4.6을 공개하며, 최신 최첨단 AI 모델이 오픈AI의 GPT-5.6 Sol 및 앤트로픽의 Fable 5와 정면으로 경쟁할 수 있는 수준이라고 밝혔다. 가격은 경쟁 모델의 약 절반 수준이다. 해당 모델은 Cursor, Grok Build, Grok Bot, 스페이스XAI API를 통해 즉시 이용 가능하다.

 

61점의 의미와 한계

 

9to5mac.com, tradingkey.com, officechai.com, basenor.com에 따르면, Grok 4.6은 12일 공개된 Artificial Analysis Intelligence Index에서 61점을 기록했다. 벤치마크의 세부 항목과 실제 업무비용까지 고려하면 ‘절대 성능 1위’보다는 비용 효율을 앞세운 에이전트 모델로 보는 것이 더 정확하다.

 

이는 직전 Grok 4.5보다 5점, Grok 4.3보다 23점 오른 수치이며, GPT-5.6 Sol Max와 동률이다. 다만 같은 평가에서 Claude Fable 5는 62점, Claude Opus 5는 63점으로 Grok 4.6보다 각각 1점과 2점 높았다. 따라서 ‘GPT-5.6 Sol과 동급’이라는 표현은 해당 종합지수에 한정하면 성립하지만, 현 시점 전체 최상위권은 앤트로픽 모델들이 근소하게 앞서는 구도다.

 

특히 Grok 4.6의 강점은 정적인 질의응답보다 여러 단계의 도구 사용과 업무 수행이 필요한 에이전트 작업에서 나타났다. Artificial Analysis에 따르면 실제 지식노동형 에이전트 업무를 측정하는 GDPval-AA v2에서 Grok 4.6은 Elo 1753점을 기록했다. Claude Opus 5 다음 수준이지만 Claude Fable 5 및 Qwen3.8 Max와는 신뢰구간이 겹쳐 통계적으로 우열을 단정하기 어렵다. 금융 고객지원형 도구 사용 평가인 τ³-Banking에서는 50.7%, 터미널 기반 소프트웨어 작업을 평가하는 Terminal-Bench v2.1에서는 88.4%를 얻었다.

 

장기 업무 수행을 평가하는 AA-Briefcase에서는 Elo 1577점을 받아 Claude Fable 5급 성능권에 진입했다. 더욱 주목할 대목은 효율이다. Artificial Analysis는 Grok 4.6이 해당 작업을 평균 약 53회 대화 턴, 약 5억 개 입력 토큰으로 끝낸 반면 Claude Opus 5 Max는 평균 약 103회 턴과 약 20억 개 입력 토큰을 사용했다고 분석했다. 장기 에이전트 업무에서는 토큰 단가뿐 아니라 작업 완료까지 필요한 대화 횟수와 누적 컨텍스트가 비용을 좌우한다는 점에서 의미 있는 지표다.

 

‘반값’의 실제 계산법


Grok 4.6의 기본 API 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러다. 캐시 입력은 100만 토큰당 0.50달러이며, 고속 버전은 기본 가격의 두 배로 책정됐다. 반면 오픈AI의 GPT-5.6 Sol은 입력 5달러, 출력 30달러다. 단순 토큰 단가 기준으로 Grok 4.6은 GPT-5.6 Sol보다 입력은 60%, 출력은 80% 저렴하다.

 

Artificial Analysis는 실제 평가 환경에서 Grok 4.6의 작업당 비용을 0.84달러로 추산했고, 이 모델을 성능 대비 비용의 ‘파레토 프런티어’에 위치한 모델로 평가했다. 다만 이 수치는 특정 벤치마크의 프롬프트 길이, 추론 설정, 도구 호출 방식, 캐시 적중률을 반영한 추정치다. 기업 사용자가 실제로 지불할 비용은 코드베이스 규모, 문서량, 재시도 횟수, 출력 길이와 작업 자동화 방식에 따라 크게 달라질 수 있다.

 

모델 확장보다 후속 학습


이번 버전은 완전히 새로운 초대형 기반모델이라기보다 Grok 4.5의 후속 학습(post-training) 강화판에 가깝다. Cursor와 스페이스XAI는 고품질 엔지니어링 데이터, 추론 및 고급 기술 개념을 위한 선별 데이터, 지도 미세조정(SFT), 강화학습(RL)을 적용했다고 설명했다. 강화학습 범위도 일반 코딩과 지식업무를 넘어 커널 최적화, 웹 개발, 컴퓨터 지원 설계(CAD) 등으로 확대했다.

 

회사는 Grok 4.6이 낯선 분야를 조사하고, 애플리케이션 구조를 설계하며, 핵심 상호작용을 구현한 뒤, 피드백에 따라 반복 개선하는 작업에 강점을 보인다고 주장했다. 그러나 이는 출시사가 제시한 사용성 평가이므로, 실제 기업 도입 단계에서는 보안성, 환각률, 코드 취약점 생성 가능성, 장기 작업의 중단·복구 능력 등을 별도 검증해야 한다. Cursor는 사전 배포 테스트와 사후 제3자 테스트를 확대했다고 밝혔지만, 세부 안전성 수치와 평가 원문은 제한적으로 공개됐다.

 

유통망과 시장의 분리


스페이스X 주가가 Grok 4.6 발표 직후 6% 이상 뛰었다는 식의 인과 해석에는 주의가 필요하다. 로이터와 블룸버그 보도에 따르면 이달 6일 스페이스X 주가가 약 6% 상승한 직접 계기는 대규모 보호예수 해제였다. 당시 약 9억1150만 주가 거래 가능해졌고, 시장은 유통주식 확대와 내부자 매도 가능성을 소화하는 과정에 있었다.

 

모건스탠리는 12일 스페이스X에 대해 투자의견 ‘비중확대’와 목표주가 300달러를 유지하면서, 강세 시나리오로 600달러를 제시했다. 당시 주가는 142.52달러, 시가총액은 약 1조8800억달러로 집계됐다. 그러나 이 보고서는 Grok 4.6의 단기 매출보다 Cursor 인수와 소비자·기업 AI 플랫폼 확장 가능성에 가치를 부여한 것이다. 모델 하나의 벤치마크 성적을 곧바로 기업가치 상승의 근거로 연결하기보다는, 유료 API 사용량과 기업 고객 확보, AI 투자비 회수 속도를 확인해야 한다.

 

Grok 4.6은 최상위 모델 간 성능 격차가 1~2점 수준으로 좁아진 시점에 등장했다. 스페이스XAI가 겨냥한 시장은 ‘가장 높은 단일 벤치마크 점수’가 아니라, 긴 업무를 덜 자주 멈추고 더 적은 토큰으로 끝내는 개발·지식노동 에이전트 시장이다. 향후 경쟁의 핵심은 파라미터 수나 홍보성 순위보다, 동일한 실제 업무를 얼마나 안정적으로 수행하고 그 과정에서 얼마의 추론비용을 발생시키느냐가 될 전망이다.

배너
배너
배너

관련기사

87건의 관련기사 더보기


[이슈&논란] "팀 쿡도 갤럭시로 갈아탔다"…삼성전자의 조롱 마케팅(미스디렉션 바이럴)이 폴더블 전쟁에 던진 신호

[뉴스스페이스=김희선 기자] 삼성전자가 애플의 첫 폴더블폰 ‘아이폰 듀오’ 공개 직후, 애플 수장과 동명이인인 뉴질랜드 남성을 전면에 내세운 ‘팀 쿡이 갤럭시로 갈아탔다’는 광고를 선보였다. Reuters, 9to5mac, abcnews, phonearena, gadgets360에 따르면, 짧은 말장난처럼 보이지만, 이 캠페인은 ‘폴더블 원조’ 이미지를 선점한 삼성이 애플의 시장 진입을 계기로 기술 리더십과 소비자 전환 욕구를 동시에 자극하려는 고밀도 소셜미디어 전쟁으로 해석된다. 동명이인 광고의 설계 삼성전자 뉴질랜드 법인은 11일 공식 인스타그램에 갤럭시 Z 폴드8을 든 ‘Tim Cook’의 사진과 함께 “큰 소식입니다. 팀 쿡이 갤럭시로 갈아탔습니다”라는 문구를 게시했다. 이어 “바로 그 팀 쿡입니다. 파머스턴노스의 팀 쿡”이라며 대상이 애플의 전·현직 경영진이 아닌 뉴질랜드 현지 동명이인임을 밝히고, “어떤 팀 쿡을 떠올렸느냐”고 되물었다. 이름을 크게, 정정 정보를 작게 배치해 소비자의 즉각적 연상을 활용한 전형적인 ‘미스디렉션(misdirection)’형 바이럴 광고다. 광고의 핵심은 팀 쿡 개인을 직접 모델로 사용하거나 사실과 다른 구매 전환을

[빅테크칼럼] “AI 곡괭이=한국 주식, 부의 소비=럭셔리, 기후 해답=물”…블룸버그가 꼽은 1만달러의 세 갈래 투자지도

[뉴스스페이스=김정영 기자] 미국 증시가 사상 최고치 부근에서 숨 고르기에 들어가고 채권시장의 변동성도 커지는 국면에서, 글로벌 자산관리 전문가들이 한국 주식과 럭셔리, 물 관련 기업을 유망 투자처로 지목했다. 표면적으로는 반도체·소비재·인프라로 나뉘지만, 이들의 공통분모는 인공지능(AI) 투자 확대, 초고액자산가의 소비 지속성, 기후변화가 만드는 물 부족이라는 장기 구조 변화다. 블룸버그는 9일(현지시간) 자산관리 전문가들에게 1만달러의 투자처를 묻는 기획에서 한국 주식, 럭셔리 기업, 물 관련 기업을 주요 후보로 제시했다. bloomberg, tradingkey, markets, mckinsey에 따르면, 미국 주식의 밸류에이션 부담이 커지고 채권시장 불확실성이 이어지는 상황에서, 이미 악재가 가격에 반영됐거나 중장기 성장 동력이 뚜렷한 영역을 찾는 자금의 시선이 세 갈래로 압축됐다는 해석이 가능하다. 한국 증시에 대한 투자 논리는 단순하다. AI 데이터센터 증설에 필요한 고대역폭메모리(HBM)와 서버용 메모리 수요 확대의 직접 수혜를 받으면서도, 밸류에이션은 글로벌 AI 수혜주 가운데 상대적으로 낮다는 것이다. 블랙록의 러스 쾨스테리히 글로벌 투자전략가