나흘 전, 역대 최대 규모의 인공지능이 가중치째로 공개됐다.
누구나 내려받을 수 있는데, 내 노트북에서는 절대 열리지 않는다.
오늘은 그 이유를 파고들면서 인공지능이 실제로 어떻게 만들어지는지 배운다.
2026년 7월 30일 · 모닝 AI · AI CITY BUILDERS
이 교재의 모든 숫자는 공식 기술 보고서와 논문에서 가져왔고, 출처는 마지막 장에 모두 열려 있다.
중국 문샷AI가 Kimi K3의 가중치를 공개했다. 논문도 함께 나왔다.
"오픈 웨이트"란 모델의 내부 숫자 전체를 누구나 내려받을 수 있다는 뜻이다. API로 빌려 쓰는 것과 근본적으로 다르다.
| 항목 | 수치 | 무엇을 뜻하나 |
|---|---|---|
| 전체 파라미터 | 2.8조 개 | 모델이 가진 지식의 총량. 공개된 것 중 최대 |
| 활성 파라미터 | 1,040억 개 | 토큰 하나를 만들 때 실제로 계산에 쓰이는 양 — 전체의 3.7% |
| 컨텍스트 | 1,048,576 토큰 | 한 번에 읽을 수 있는 분량. 책 열 권 규모 |
| 전문가 수 | 896개 중 16개 | 내부가 896개 조각으로 나뉘어 있고, 매번 16개만 켜진다 |
| 저장 형식 | MXFP4 | 가중치 하나를 4비트로 저장. 학습 단계부터 이 형식을 전제로 훈련 |
| 학습 효율 | 2.5배 | 같은 계산량으로 이전 모델(K2)보다 2.5배 더 똑똑해졌다는 주장 |
출처: Kimi K3 기술 보고서(arXiv:2607.24653) 및 문샷AI 공식 기술 블로그. 성능은 Artificial Analysis 지능 지수 189개 모델 중 4위, Vals 실무 지수 38개 중 2위로 측정됐다.
여기서 첫 번째 이론이 나온다. 예전 인공지능은 질문 하나에 뇌 전체를 다 썼다.
지금은 필요한 부분만 켠다. 이걸 희소성이라 부른다.
MoE(Mixture of Experts)를 병원으로 이해하면 정확하다.
종합병원에 전문의가 896명 있다. 환자가 올 때마다 전원 회의를 열면 병원이 망한다.
그래서 접수 데스크가 증상을 보고 딱 맞는 16명만 호출한다.
위 격자는 실제 896개를 하나씩 그린 것이다. 이 중 금색 16개만 켜진다. K3의 이 구조를 문샷은 Stable LatentMoE라 부른다.
지금의 모든 거대 모델은 아홉 년 전 논문 하나에서 갈라져 나왔다.
새로 나온 기술이 아니라, 오래된 아이디어가 드디어 실현된 것이다.
1개도 아니고 896개도 아니고 16개. 이 숫자는 감이 아니라 연구로 찾아낸 값이다.
최근 논문들이 밝혀낸 결론이 특히 중요하다.
전문가를 많이 만드는 건 쉽다. 어려운 건 골고루 쓰이게 만드는 것이다.
이 문제를 못 풀면 2.8조는 그냥 낭비된 저장 공간이 된다.
"컨텍스트 100만"은 광고 문구처럼 보이지만, 계산량으로 보면 무서운 숫자다.
원래 어텐션은 토큰마다 앞의 모든 토큰을 다시 본다. 그래서 비용이 길이의 제곱으로 늘어난다.
| 컨텍스트 길이 | 비교해야 할 토큰 쌍 | 연산량 (1천 토큰 기준) |
|---|---|---|
| 1,000 토큰 (A4 두 장) | 약 100만 쌍 | 1배 |
| 10,000 토큰 (보고서 하나) | 약 1억 쌍 | 100배 |
| 100,000 토큰 (단행본 한 권) | 약 100억 쌍 | 1만 배 |
| 1,048,576 토큰 (K3) | 약 1조 1천억 쌍 | 100만 배 |
K3의 어텐션은 Kimi Delta Attention(KDA)이다. 원리는 의외로 직관적이다.
양자화는 숫자 하나를 몇 비트로 적을지를 정하는 일이다.
이 계산은 초등학교 산수다. 직접 해보면 왜 안 돌아가는지 즉시 이해된다.
| 저장 형식 | 가중치 1개당 | 2.8조 개면 | 현실 |
|---|---|---|---|
| FP16 (학습 기본) | 16비트 | 5.6 TB | 불가능 |
| FP8 | 8비트 | 2.8 TB | 불가능 |
| MXFP4 (K3 공개 형식) | 4비트 | 1.4 TB | 가속기 64개 이상 |
가중치는 누구나 내려받을 수 있다. 그런데 열 곳이 없다.
| 장비 | 메모리 | K3를 담을 수 있나 |
|---|---|---|
| 맥북 프로 (통합 메모리 36GB) | 36 GB | 1.4TB의 2.6% — 불가 |
| RTX 5090급 그래픽카드 | 32 GB | 불가 |
| H100 · H200 · B200 한 장 | 80~192 GB | 한 장으로는 불가 |
| 문샷 권장 구성 | 가속기 64개 이상 | 가능 (수십억 원대) |
참고로 API로 빌려 쓸 때 K3의 가격은 입력 100만 토큰당 3달러, 출력 100만 토큰당 15달러다(캐시 적중 시 입력은 0.3달러). 이 숫자는 뒤에서 다시 쓴다.
방금 배운 공식 하나로 직접 계산할 수 있다. 파라미터 × 비트 ÷ 8.
| 모델 | 4비트 계산 | 실제 필요 용량 | 어디서 도나 |
|---|---|---|---|
| Gemma 3 · 4B | 40억 × 4 ÷ 8 | 약 2 GB | 8GB 노트북에서도 여유 |
| Qwen3 8B · Llama 3.3 8B | 80억 × 4 ÷ 8 | 약 5~6 GB | 16GB 노트북의 최적점 |
| 중형 모델 · 30B급 | 300억 × 4 ÷ 8 | 약 18~20 GB | 32GB 이상 필요 |
| Kimi K3 · 2.8T | 2.8조 × 4 ÷ 8 | 1.4 TB | 개인 장비 불가 |
8비트보다 4비트(Q4_K_M)가 노트북에서는 정답이다. 용량이 절반이고 발열과 연산도 줄어든다.
전용 그래픽카드가 없어도 돈다. 사람이 읽는 속도 정도라, 대화형 서비스에는 충분히 쓸 만하다.
2년 전 8B는 장난감이었다. 지금 8B는 요약·분류·추출·상담 같은 실무를 해낸다. 이게 흐름의 핵심이다.
여기서 중요한 통찰 — 대부분의 서비스는 프론티어 모델이 필요하지 않다. 필요한 건 "충분히 잘하는 모델"이고, 그건 이미 내 노트북에 들어간다.
이건 이론이 아니라 손익계산서 문제다. 우리 수강생들이 지금 실제로 겪고 있다.
누군가는 과금이 무서워 기능을 숨겨뒀고, 누군가는 질문 하나마다 본인이 돈을 물고 있었다.
| 사용자 수 | 하루 대화 | API 방식 월 비용 | 로컬 방식 월 비용 |
|---|---|---|---|
| 10명 | 100회 | 약 4.5만 원 | 전기료 |
| 100명 | 1,000회 | 약 45만 원 | 전기료 |
| 1,000명 | 10,000회 | 약 450만 원 | 전기료 |
| 10,000명 | 100,000회 | 약 4,500만 원 | 전기료 |
여기가 많은 분들이 놓치는 부분이다. LM Studio와 Ollama는 OpenAI와 똑같은 형식의 주소를 열어준다.
그래서 이미 만들어둔 코드에서 주소만 바꾸면 로컬 모델로 넘어간다.
내 노트북에서 못 돌린다고 남의 일이 아니다. 세 가지가 실제로 바뀐다.
비슷한 성능을 누구나 직접 돌릴 수 있게 되면, API 가격은 그 이상으로 올라가지 못한다. 1인 기업에게는 원가가 계속 내려간다는 뜻이다.
서비스 전체가 한 회사 API에 얹혀 있으면, 그쪽 가격·정책·중단에 내 사업이 흔들린다. 대체할 수 있는 선택지가 존재한다는 것 자체가 협상력이다.
가중치와 논문이 열려 있으니 연구자 누구나 확인하고 개선한다. 오늘 본 KDA·최적 희소성 같은 이론이 빠르게 도는 이유가 이것이다.
거대 모델에서 검증된 구조는 몇 달 뒤 작은 모델로 내려온다. 오늘의 2.8조가 내년의 8B에 들어간다. 그때 준비된 사람이 먹는다.
| 이론 | 한 줄 정리 | 내 서비스에서는 |
|---|---|---|
| 희소성 | 아는 것과 쓰는 것을 분리한다 | 기능은 넓게, 요청당 비용은 얇게 |
| MoE | 896명 중 16명만 호출한다 | 모든 요청에 최고 모델을 쓸 필요는 없다 |
| 최적 희소성 | 기억은 총량, 추론은 활성량에서 온다 | 어려운 일에만 큰 모델을 붙인다 |
| 라우팅 균형 | 안 쓰이는 전문가는 낭비다 | 안 쓰는 기능은 지우는 게 낫다 |
| 어텐션 비용 | 길이가 1,000배면 계산은 100만 배 | 프롬프트를 길게 넣을수록 돈이 나간다 |
| 선형 어텐션 | 쌓지 않고 고쳐 쓴다 | 대화 전체를 매번 보낼 필요가 없다 |
| 양자화 | 파라미터 × 비트 ÷ 8 | 내 장비에 뭐가 들어가는지 직접 계산한다 |
AI CITY BUILDERS · 모닝 AI EP.20 · 2026년 7월 30일
수치는 작성 시점의 공개 자료 기준이며, 상업적 이용 전에는 저장소의 라이선스 파일을 직접 확인해야 한다.