TL;DR — 중국 AI 스타트업 문샷AI(Moonshot AI)킴미 K3(Kimi K3)가 7월 16일 상하이 세계AI컨퍼런스에서 공개됐다. 2조 8천억 파라미터의 이 모델은 Arena.ai 프론트엔드 코드 아레나에서 Claude Fable 5와 GPT-5.6을 제치고 1위를 기록했으나, 출시 이틀 만에 GPU 용량 초과로 신규 구독이 중단됐다. 독립 평가기관 Artificial Analysis는 할루시네이션 비율이 전작 대비 39% → 51%로 상승했음을 밝혔다. 미국 반도체 지수는 K3 출시 후 20% 이상 폭락했으며, 오픈 웨이트는 7월 27일 HuggingFace에 공개될 예정이다. 미국 정부는 앤트로픽 모델에 대한 대규모 증류 공격 혐의를 공식 제기했다.

2025년 초 딥시크(DeepSeek)가 미국 AI 업계를 뒤흔들었던 것처럼, 2026년 7월에는 킴미 K3가 또 한 번 충격을 안겼다. 글로벌 AI 미디어와 월스트리트, 워싱턴 정가가 동시에 반응한 이번 사태를 두고 Axios는 "AI 레이스를 하룻밤 만에 리셋했다"고 표현했다.

무엇이 등장했나 — 킴미 K3의 스펙과 성과

킴미 K3는 베이징 기반 스타트업 문샷AI가 개발한 2조 8천억(2.8T) 파라미터 모델로, 2026년 7월 16일 상하이 세계AI컨퍼런스(World AI Conference)에서 공식 공개됐다. 모델의 주요 특징은 세 가지다.

첫째, 코딩 벤치마크 1위. Arena.ai가 개발자 블라인드 투표로 운영하는 프론트엔드 코드 아레나에서 K3는 1,679점(승률 76%) 으로 1위에 올랐다. Claude Fable 5(1,631점)와 GPT-5.6 Sol Max를 앞선 결과다. 이 순위는 문샷AI가 아닌 개발자 커뮤니티가 직접 평가한 독립 결과여서 신뢰도가 높다.

둘째, 사실상 무료에 가까운 가격. K3는 경쟁 미국 모델 대비 현저히 낮은 비용으로 제공되며, 소비자 플랫폼(kimi.com)에서는 무료로 사용할 수 있어 출시 직후 수요가 폭발했다.

셋째, 오픈 웨이트 공개 예정. 7월 27일 HuggingFace에 전체 모델 가중치를 Modified MIT 라이선스로 공개할 계획이다. 약 3조 파라미터급 모델의 오픈 웨이트 공개는 사실상 처음이다. 이와 함께 100만 토큰을 지원하는 1,048,576 토큰 컨텍스트 윈도우도 탑재됐다.

파라미터 수 2.8조 (2,800B)
컨텍스트 윈도우 1,048,576 토큰 (~100만 토큰)
Arena.ai 코딩 순위 1위 / 1,679점 / 승률 76%
Artificial Analysis 종합 지수 57.1점 (전체 4위, Claude Fable 5는 59.9점)
할루시네이션 비율 ~51% (전작 K2.6 대비 +12%p 상승)
사실 정확도 33% → 46% (전작 대비 개선)
문샷AI 연간반복매출(ARR) 4월 $2억 → 6월 $3억 (2개월 내 50% 성장)

이틀 만에 구독 중단 — 과부하와 시장 충격

K3에 대한 반응은 예상을 초과했다. 공개 후 48시간 이내에 GPU 용량을 초과해 문샷AI는 신규 소비자 구독을 일시 중단했다. 연간반복매출(ARR)은 4월 2억 달러에서 6월 3억 달러로 두 달 새 50% 성장했고, K3 출시 이후 이 속도가 더 가팔라질 것으로 전망된다.

금융 시장의 반응도 즉각적이었다. 필라델피아 반도체 지수(SOXX)는 K3 출시 이후 6월 말 고점 대비 20% 이상 하락해 기술적 약세장 기준을 충족했다. 이는 2025년 4월 이후 반도체 업계 최악의 주간 하락폭으로, '저비용 고성능 중국 모델이 미국 칩 수요를 잠식할 수 있다'는 투자자들의 공포가 반영됐다.

워싱턴의 반응 — 증류 공격 혐의와 수출 통제

미국 정부의 반응은 강경했다. 백악관 OSTP 국장 마이클 크라트시오스(Michael Kratsios)는 문샷AI가 앤트로픽(Anthropic)의 Fable 모델에 대해 대규모 은밀한 증류(distillation) 공격을 감행해 K3를 개발했다고 공개 비난했다. 앤트로픽이 2026년 2월 발표한 증류 분석 보고서에는 문샷AI가 약 340만 개의 가짜 계정을 이용해 대규모 데이터 수집을 시도했다는 내용이 담겨 있다.

재무장관 스콧 베센트(Scott Bessent)는 미국 모델에서 능력을 '증류'하는 중국 AI 기업에 대한 제재 가능성을 경고했다. 추가로 크라트시오스는 태국을 통한 엔비디아 GB300 칩 우회 확보 의혹도 제기했다. 7월 24일 기준 공식 제재 조치는 아직 발표되지 않았다.

팁 — 기업 도입 전 반드시 확인할 사항: 킴미 K3는 코딩 작업에서 인상적인 성능을 보이지만, 독립 평가에서 측정된 51% 할루시네이션 비율은 사실 민감 업무(법무·의료·금융 리서치 등)에서 심각한 리스크가 된다. 코딩 생산성 도구로는 고려할 수 있으나, 사실 기반 출력이 중요한 업무에는 신중한 검증이 필요하다. 또한 오픈 웨이트 공개 이후에도 중국 법률상 데이터 관할권 이슈는 남는다.

핵심 쟁점 — 할루시네이션 증가와 투명성 부재

성능 지표에서 가장 주목해야 할 숫자는 할루시네이션 비율이다. Artificial Analysis의 독립 평가(AA-Omniscience 벤치마크)에서 K3의 할루시네이션 비율은 전작 K2.6의 39%에서 약 51%로 12%p 상승했다. 사실 정확도는 33%→46%로 개선됐지만, 이는 '맞은 답은 더 잘 맞히고 틀린 답은 더 자신감 있게 틀린다'는 의미다.

더 큰 문제는 투명성의 부재다. 문샷AI의 공식 벤치마크 자료에는 사실 정확도 개선 수치만 포함돼 있고 할루시네이션 비율 상승은 언급되지 않았다. 오픈 웨이트 공개 전까지 독립적인 재현 실험도 불가능했기 때문에, 현재까지의 모든 성능 수치는 문샷AI의 자체 평가 또는 API 접근에 의존한 한계를 가진다.

항목 K2.6 (전작) K3 Claude Fable 5 참고
Artificial Analysis 종합 지수 57.1 (4위) 59.9 (1위)
Arena.ai 코딩 순위 1위 / 1,679점 2위 / 1,631점
할루시네이션 비율 (AA-Omniscience) ~39% ~51% ~54.9%
사실 정확도 ~33% ~46%
오픈 웨이트 없음 7/27 공개 예정 없음
컨텍스트 윈도우 100만 토큰
이 기사의 수치는 CNN Business(2026.07.24), TechTimes(2026.07.24), Economic Times(2026.07.24) 보도 및 Artificial Analysis의 독립 평가 결과에 근거한다. 킴미 K3 오픈 웨이트는 기사 작성 시점(2026.07.25) 기준 아직 공개되지 않았으며, 예정일은 7월 27일이다. 미국 정부의 제재 여부 등 관련 상황은 빠르게 변화하고 있어 최신 정보 확인이 필요하다.

그래서 무엇이 달라지나

딥시크가 2025년에 '저비용으로도 고성능이 가능하다'는 것을 증명했다면, 킴미 K3는 '중국이 프론티어 모델에 근접하는 속도가 예상보다 빠르다'는 점을 다시 한번 확인시켰다. 오픈 웨이트 공개는 개발자·기업·각국 정부가 K3를 자체 인프라에서 구동하고 파인튜닝할 수 있게 해줌으로써, 미국의 수출 통제 효과를 일부 상쇄할 수 있다는 점에서 정책적으로도 중요하다.

그러나 51%의 할루시네이션 비율, 법적 미해결 상태의 증류 의혹, 중국 법상 데이터 관할권 문제는 기업 환경에서 K3 도입을 복잡하게 만드는 요인이다. '코딩 순위 1위 모델'과 '기업에서 안심하고 쓸 수 있는 모델' 사이에는 아직 상당한 거리가 있다.

  • 문샷AI, 7월 16일 상하이에서 킴미 K3 공개 — 2.8조 파라미터, 100만 토큰 컨텍스트
  • Arena.ai 프론트엔드 코딩 아레나 1위(1,679점) — Claude Fable 5, GPT-5.6 추월
  • 출시 48시간 이내 GPU 과부하로 신규 구독 중단, 반도체 지수 20%↓ 폭락
  • 독립 평가 할루시네이션 비율: 전작 39% → K3 51% (12%p 상승, 문샷 공식 자료에 미포함)
  • 오픈 웨이트 7/27 HuggingFace 예정 — 3조 파라미터급 최초 공개 모델 전망
  • 미 백악관, 앤트로픽 모델에 대한 340만 계정 증류 공격 의혹 공식 제기
관련 자료 · 공식 출처
· Moonshot AI — 공식 사이트
· Kimi — 공식 서비스
· Moonshot AI — HuggingFace 오픈 웨이트 저장소
· Artificial Analysis — 독립 모델 평가