7월 16일, Moonshot AI가 Kimi K3를 공개했습니다. 앱과 웹, Kimi Work, Kimi Code, API에서 바로 쓸 수 있게 열었고, 11일 뒤인 7월 27일에는 전체 가중치와 기술보고서도 내놨습니다. 2.8조 파라미터, 100만 토큰 문맥, 이미지 이해까지 지원하는 모델입니다.

눈에 들어온 건 숫자만이 아니었습니다. 7월 19일 Moonshot은 지난 48시간의 수요가 현재 GPU 용량 한계에 가까워졌다며 신규 구독을 잠시 멈췄습니다. 새 모델이 화제가 되는 일은 흔하지만, 출시 사흘 만에 가입부터 조절한 일은 모델 경쟁에서 공급 능력도 성능만큼 중요해졌다는 사실을 보여줍니다.

며칠 사이 DeepSeek는 V4 계열을 밀고 있었고, Alibaba Cloud에는 Qwen3.8-Max-Preview가 올라왔습니다. 중국 AI를 이야기할 때 더 이상 “DeepSeek가 싸다” 한 문장으로는 설명이 되지 않습니다. 성능, 가격, 공개 방식, 클라우드 유통이 동시에 움직이고 있습니다.

제가 이 세 모델의 자료를 한꺼번에 다시 본 이유도 여기에 있습니다. 누가 벤치마크 1위인지 가리는 일보다, 실제 모델 선택표에 중국 모델을 기본 후보로 넣어야 하는지가 더 중요한 질문이 됐습니다.

Kimi K3의 숫자는 인상적이다. 단, 회사가 낸 숫자다

Kimi K3는 질문마다 전체 2.8조 파라미터를 다 쓰지 않습니다. Mixture of Experts 방식으로 896개 전문가 모듈 가운데 16개를 활성화합니다. 거대한 모델을 매번 통째로 돌리는 대신, 들어온 작업에 맞는 일부 경로만 사용하는 구조입니다.

Moonshot은 자체 발표에서 K3가 코딩, 브라우징, 자동화, 지식 업무의 여러 항목에서 상위 모델과 비슷하거나 앞섰다고 밝혔습니다. 사람이 결과를 골라 평가하는 Frontend Code Arena 순위도 근거로 제시했습니다.

여기서 한 번 멈춰 볼 필요가 있습니다. 본문에 넣은 표는 Moonshot의 자체 평가입니다. 모델마다 Kimi Code, Claude Code, Codex 등 서로 다른 실행 환경을 썼고, 추론 강도와 fallback 조건도 완전히 같지 않습니다. Moonshot은 오히려 자기 글에서 K3의 전반적인 성능이 Claude Fable 5와 GPT-5.6 Sol에는 아직 뒤진다고 적었습니다.

저는 이 대목이 마음에 들었습니다. 모든 칸에서 이겼다고 포장하는 대신, 잘하는 구간과 사용자 경험의 격차를 함께 써놨기 때문입니다. 반대로 이 표 하나로 “중국 모델이 최고가 됐다”고 말하는 기사라면 신뢰하기 어렵습니다.

K3의 실제 장점은 최고점 하나보다 범위에 있습니다. 긴 문서와 이미지, 코딩 도구, 100만 토큰 문맥을 한 모델에서 다룰 수 있고, API도 공개 당일부터 열렸습니다. 다만 중간에 다른 모델로 바꾸거나 thinking history가 제대로 전달되지 않으면 품질이 흔들릴 수 있다는 제한도 기술자료에 적혀 있습니다. 과도하게 선제 행동을 할 수 있으니 system prompt나 AGENTS.md에서 경계를 더 분명히 두라는 경고도 있습니다.

오픈웨이트라는 말은 무료와 같지 않다

Kimi K3의 전체 가중치는 7월 27일 공개됐습니다. 누구나 파일을 내려받아 살펴보고, 호스팅 업체가 추론 서비스를 만들 수 있다는 뜻입니다. 그렇다고 아무 조건 없는 오픈소스는 아닙니다.

K3는 별도의 Kimi K3 License를 씁니다. 일반적인 연구와 개발, 많은 상업적 이용을 허용하지만, 일정 규모 이상의 Model-as-a-Service 사업자는 별도 계약이 필요합니다. 표시 의무도 있습니다. 모델 파일이 공개됐다는 사실과 상업적으로 아무 제약이 없다는 말은 다릅니다.

운영비도 남습니다. 2.8조 파라미터 모델을 직접 돌리려면 GPU와 추론 엔진, 장애 대응이 필요합니다. Moonshot은 64개 이상 가속기를 연결한 supernode 구성을 권장합니다. 개인이나 보통 회사가 가중치를 내려받았다고 곧바로 저렴하게 운영할 수 있는 크기가 아닙니다.

그래서 오픈웨이트의 실제 힘은 “모두가 자기 서버에서 공짜로 쓴다”보다 “여러 추론 사업자가 같은 모델을 서비스하며 가격과 배포 지역을 놓고 경쟁한다”는 데 있습니다.

DeepSeek는 성능보다 가격표를 먼저 흔든다

DeepSeek V4-Pro의 직접 API 가격은 8월 4일 확인 기준으로 cache miss 입력 100만 토큰당 0.435달러, 출력 0.87달러입니다. Kimi K3는 cache miss 입력 3달러, 출력 15달러입니다. 같은 중국 모델끼리도 가격 차이가 큽니다.

물론 토큰 단가만으로 모델을 고르면 안 됩니다. 같은 일을 끝내는 데 더 많은 토큰을 쓰거나, 답이 느리거나, 재검토가 늘면 싸게 시작한 비용이 금방 불어납니다. 그래도 입력과 출력이 많은 배치 작업에서는 이 차이를 무시하기 어렵습니다.

OpenRouter가 공개한 자료에서도 이런 움직임이 보입니다. 2026년 1월 1일부터 6월 14일까지 자사 플랫폼에서 처리된 450조 토큰 이상을 분석했더니, DeepSeek 계열의 비중이 1월 약 9%에서 6월 초 약 18%로 늘었습니다. 이것은 세계 시장점유율이 아닙니다. OpenRouter라는 한 플랫폼의 토큰 사용량입니다. 그래도 개발자가 여러 모델 중 어디로 트래픽을 옮기는지 보여주는 신호로는 쓸 만합니다.

제가 모델 도입안을 만든다면 벤치마크 3점 차이보다 이 값을 먼저 봅니다. 월간 입력량, 출력량, 실패 후 재시도 비율, 사람이 고치는 시간까지 넣으면 모델 비용표가 완전히 달라지기 때문입니다.

Qwen3.8은 아직 평가보다 관찰이 먼저다

Qwen3.8-Max-Preview는 Alibaba Cloud Model Studio의 Token Plan에서 제공되고 있습니다. 공식 안내에서 확인되는 것은 preview 모델의 제공 범위와 사용 방법입니다.

하지만 이름 그대로 preview입니다. 8월 4일 제가 확인한 공식 페이지에서는 최종 모델 카드, 공개 가중치, 확정 라이선스와 독립 평가를 찾지 못했습니다. Kimi K3나 DeepSeek V4-Pro와 같은 표에 넣고 승패를 가르기에는 자료가 부족합니다.

Qwen에서 먼저 봐야 할 대목은 점수보다 유통입니다. Alibaba Cloud와 Model Studio 안에서 바로 시험할 수 있다는 점은 기존 고객의 도입 단계를 줄여줍니다. 이것만으로 실제 채택 우위를 단정할 수는 없지만, 모델 성능과 별개로 배포 경로가 선택에 영향을 준다는 점은 분명합니다.

미국 기업에 더 직접적인 압력은 가격이다

현재 인용한 가격표에서 분명히 확인되는 것은 DeepSeek V4-Pro가 Kimi K3보다 훨씬 싸다는 점입니다. 미국 모델까지 한꺼번에 묶어 가격 우위를 단정하려면 같은 시점의 공식 요금과 cache 조건을 따로 맞춰야 합니다. 다만 이런 가격 차이가 커질수록, 높은 단가를 성능만으로 설명하기는 어려워집니다.

실제 이동이 이미 벌어졌다고 단정할 필요도 없습니다. 앞서 본 OpenRouter 자료에서 DeepSeek 계열 비중이 약 9%에서 18%로 늘어난 것만으로도, 가격과 성능이 맞으면 트래픽을 다시 배분해 보는 사용자가 있다는 정도는 확인할 수 있습니다.

오픈웨이트 모델은 선택 경로도 넓힙니다. 한 API만 보는 대신 같은 모델을 서비스하는 여러 추론 업체의 가격, 지역, 데이터 정책을 비교할 수 있습니다. 결국 경쟁의 기준이 모델 점수 하나에서 실제 청구액과 공급 안정성으로 옮겨갑니다.

지금 고른다면 이렇게 나누겠다

중국 모델이 모두 같은 용도는 아닙니다. 제가 지금 선택표를 만든다면 다음처럼 나눕니다.

필요한 일먼저 볼 후보확인할 조건
대량 텍스트 처리와 낮은 단가DeepSeek V4-Pro실제 출력 길이, 지연시간, 재시도율, 데이터 처리 위치
긴 문맥, 이미지, 코딩을 한 모델로 처리Kimi K3Kimi Code 호환성, 중간 모델 전환 금지, 라이선스, 공급 안정성
Alibaba Cloud 안에서 빠르게 시험Qwen3.8-Max-Previewpreview 변경 가능성, 최종 가격, 모델 카드, 가중치 공개 여부
고객정보나 규제 데이터모델보다 제공 사업자부터저장 지역, 로그 보존, 삭제 정책, 계약상 책임

대량의 텍스트를 낮은 비용으로 처리하려면 DeepSeek부터 비용을 재보겠습니다. 긴 문맥과 이미지, 코딩을 함께 다뤄야 한다면 K3를 시험하되 Moonshot이 밝힌 실행 환경의 제약을 그대로 검증 항목에 넣겠습니다. Qwen3.8은 성급히 표준 모델로 고정하지 않고 preview가 끝난 뒤 다시 보겠습니다.

그리고 한 모델만 남기지는 않겠습니다. 가격이나 접속 정책은 빠르게 바뀝니다. 우리 조직에서 자주 들어오는 문서와 요청을 두세 모델에 정기적으로 돌리고, 정확도 한 줄보다 완료 비용과 사람이 고친 시간을 기록하는 편이 낫습니다.

중국 AI는 어디까지 왔나

중국 AI가 미국을 이겼다고 단정할 단계는 아닙니다. Kimi K3의 공식 자료도 최고 폐쇄형 모델과의 격차를 인정합니다. DeepSeek의 가격은 강력하지만 모든 작업에서 품질과 효율이 같은 것은 아닙니다. Qwen3.8은 아직 preview입니다.

그래도 한 가지는 달라졌습니다. 중국 모델을 “싼 대안”으로만 묶어두기 어려워졌습니다. 성능이 올라왔고, 가격은 더 낮으며, 오픈웨이트와 클라우드 유통까지 갖춰지고 있습니다. 이제 미국 제품끼리만 비교하면 중요한 선택지 하나를 처음부터 지우는 셈입니다.

제 결론은 승패보다 운영에 가깝습니다. 중국 모델을 기본 후보군에 넣되, 회사가 낸 벤치마크와 독립 평가를 나누고, 오픈웨이트와 자유로운 상업 사용을 구분하고, 토큰 단가가 아니라 실제 완료 비용을 재야 합니다. 중국 AI의 가장 큰 변화는 1등 모델 하나가 나온 것이 아니라, 무시하기 어려운 선택지가 여러 개 생겼다는 점입니다.

Kimi가 공개한 Kimi K3와 주요 AI 모델의 코딩, 지식 업무, 자동화, 브라우징, 시각 작업 벤치마크 비교표
Moonshot AI가 Kimi K3 기술자료에 실은 벤더 자체 평가입니다. 모델별 harness와 조건이 달라 독립 순위표로 읽으면 안 됩니다.Moonshot AI, Kimi K3 technical report

참고한 자료