전문 · CHAPTER 03

작아도 똑똑하게 — 엣지 AI와 3진의 효율

들어가며

저는 가끔 제 폰을 손에 쥐고 무게를 가늠해 봅니다. 200그램 남짓. 그 안에 들어 있는 것은 4기가에서 12기가 사이의 메모리, 손톱만 한 NPU, 그리고 하루를 넘기기 버거운 배터리입니다. 그런데 세상은 이 작은 기계에게 "지능"을 요구합니다.

저는 이 장에서 여러분에게 한 가지를 솔직히 털어놓고 시작하려 합니다. 2026년 현재, 인공지능 산업이 마주한 진짜 벽은 모델이 똑똑하지 못해서가 아닙니다. 너무 커서, 너무 멀리 있어서, 너무 비싸서입니다. 우리는 세 가지 역설 앞에 서 있습니다.

첫째, 훈련보다 구동이 비쌉니다. 거대 모델 하나를 학습시키는 비용보다, 천 명의 사용자가 자기 폰에서 그 모델을 천 번 돌리는 누적 비용이 더 큽니다. 둘째, 사람은 클라우드가 아니라 주머니 속에 있습니다. 진짜 개인의 AI는 멀리 있는 데이터센터에 질의하는 것이 아니라, 손안에서 직접 생각하는 것이어야 합니다. 셋째, 효율이 곧 자유입니다. 전력과 지연과 비용이 줄어들수록, 더 많은 사람이 인공지능의 혜택 안으로 들어옵니다.

이 세 역설을 푸는 열쇠로 크라우니가 택한 것이 3진법입니다. 이 장은 그 선택의 기술적 근거를 — 게이트 단위의 회로부터 토큰당 줄(joule) 단위의 에너지까지 — 백서의 정밀도로 풀어내려 합니다. 그리고 마지막에, 다시 제 목소리로 돌아와 이 모든 수치가 무엇을 향하는지 말씀드리겠습니다.

---

3.1 엣지 SLM의 역사적 필연성

3.1.1 대규모 모델의 수렴과 한계

2023–2025년에 걸쳐 LLM의 규모는 지수적으로 팽창했다. GPT-3에서 GPT-4로, Claude에서 Opus로. 파라미터 수는 1,750억을 넘었고, 학습 데이터는 수조 토큰에 달했다. 그 귀결은 세 가지였다.

  1. 학습 비용의 급증. Frontier 모델 한 번의 학습 비용이 수천만 달러대에 진입했다.
  2. 추론 비용의 분담 불능. 동일 모델을 초당 1,000명이 사용하면, 그 1,000명의 추론 비용(토큰당 가격의 누적)은 학습 비용을 배수로 초과한다. 비용 구조의 무게중심이 학습에서 구동으로 옮겨간 것이다.
  3. 지연과 주권의 타협. 진정한 개인정보 보호는 기기 위에서의 구동을 요구하는데, 대규모 모델은 폰 메모리(4–12GB) 안에 들어가지 않는다.

이 지점에서 업계는 두 갈래로 나뉘었다. 한쪽은 규모 경쟁의 지속(OpenAI·Google·Anthropic 등)으로, 10~100B 모델이 각종 벤치마크에서 우위임을 입증하는 길이다. 다른 한쪽은 SLM(Small Language Model)의 효율 추격(Microsoft·Meta·Alibaba 등)으로, 2B·1B 모델로도 "충분한" 작업을 빠르고 싸게 처리하는 길이다.

크라우니는 제3의 길을 택했다.

3.1.2 크라우니의 선택: 규칙기반과 엣지 SLM의 이원화

일반 LLM 아키텍처는 단일 신경망 가중치 안에 모든 지식을 압축한다. 크라우니는 이를 거부하고 다음 3층을 물리적으로 분리한다.

층역할구현기기
L2: 4상 의사결정 엔진티/옴/타/음 근거 판단셀코어 규칙기반(1,414줄) + 4상균형3진 로직Jetson Orin, RPi5, 폰
L1: 순수 3진 SLM텍스트·이미지·음성 이해BitNet b1.58 계열(2B~50M 파라미터)폰, 엣지 기기
L0: 양자화 고속경로2비트 1트릿 초경량 추론가중치 ∈ {−1, 0, +1}, 곱셈 제거저전력 마이크로컨트롤러, IoT

이 분리의 핵심은 위계에 있다. L2가 L1을 윤활유처럼 사용한다. L1 자체가 만능 두뇌인 것이 아니라, L2의 규칙 판단이 "어디에 신경망을 적실지"를 먼저 정한다. 신경망은 판단의 주체가 아니라 판단을 돕는 매개다. 이 설계 철학이 이 장 전체의 효율 수치를 떠받친다.

---

3.2 3진 가중치와 곱셈의 소멸

3.2.1 이진 대 삼진: 연산 메커니즘

이진(Binary) 신경망의 가중치는 w ∈ {−1, +1}이다. 부호만 저장하고 크기는 없다. 순전파는 y = Σ wᵢ × aᵢ로, 여전히 곱셈기를 요구한다.

삼진(Ternary Weight Networks)의 가중치는 w ∈ {−1, 0, +1}, 세 상태다. 순전파는 y = Σ sgn(wᵢ) ⊙ aᵢ로, 조건부 덧셈·뺄셈·스킵으로 환원된다.

  • wᵢ = +1: 활성값 aᵢ를 더한다.
  • wᵢ = −1: 활성값 aᵢ를 뺀다.
  • wᵢ = 0: 스킵한다. 아무것도 하지 않는다.

CPU 명령어 수준에서 이는 곱셈의 완전한 제거를 뜻한다. 이진 경로가 sum += weight[i] * activation[i] 한 줄의 곱셈-누산을 요구하는 자리에서, 삼진 경로는 가중치가 +1이면 더하고, −1이면 빼고, 0이면 건너뛰는 분기만을 남긴다. 곱셈기는 회로에서 사라진다.

3.2.2 하드웨어 임팩트: 면적·전력·속도

곱셈기의 비용을 ASIC/FPGA 게이트 단위로 보면 그 차이가 분명하다.

  • 32비트 부동소수점 곱셈기: 약 2,000–3,000 게이트, 동작 시 소비전력 20–50 mW
  • 32비트 덧셈기: 약 200–400 게이트, 소비전력 2–5 mW

즉 곱셈기 1개가 덧셈기 약 10개분의 면적·전력을 차지한다. 신경망 연산의 절대다수가 곱셈-누산이므로, 곱셈을 덧셈·뺄셈·스킵으로 환원하면 다음이 따라온다.

  1. 칩 면적 10–30% 감소 (동일 연산량 기준)
  2. 평균 전력 20–50% 감소 (메모리 접근·오버헤드 포함)
  3. 캐시 미스 감소. 0 가중치가 만드는 희소성 덕분에 해당 가중치는 메모리에서 읽지 않는다.

곱셈을 덧셈으로 환원한다는 이 한 문장이, 회로 면적·전력·메모리 대역폭의 세 축을 동시에 끌어내린다.

---

3.3 크라우니집사: 실장된 3진 엣지 인텔리전스

3.3.1 아키텍처: L0–L2 적층

크라우니집사(Crowny Butler)는 Jetson Orin을 기준 엣지 노드로 삼아 다음 스택으로 구현된다. 최상단 L2는 셀코어 규칙기반 의사결정으로 분별과 4상균형3진 엔진(1,414줄)을 담당한다. 그 아래 L1은 순수 3진 SLM(BitNet b1.58 계열, 2B~50M 파라미터, 가중치 ∈ {−1, 0, +1})이다. 최하단 L0은 2비트 1트릿 양자화 고속경로로, IoT 센서급 마이크로 추론을 맡는다.

기기별 실장 현황은 다음과 같다.

  • Jetson Orin NX: 100GB/s 메모리 대역폭, L1 추론 30–50ms/토큰
  • Raspberry Pi 5: ARM Cortex-A76×4, L1 기본 추론 200–300ms/토큰
  • Apple Silicon (M4 Pro): 신경 엔진 + CPU, L1 15–25ms/토큰
  • 스마트폰 (Snapdragon 8 Gen 3): Hexagon DSP, L1 100–150ms/토큰
  • IoT (STM32H7, RP2040): L0만 구동, 5–10ms 마이크로 추론

3.3.2 L1 구현: BitNet 상세

크라우니는 Microsoft의 BitNet b1.58 2B4T 아키텍처(20억 파라미터, 4조 토큰 학습)를 채택하고 확장한다.

순전파에서 선형층은 선형(x) = x @ W로, 가중치 행렬 W의 각 원소는 {−1, 0, +1} 중 하나다. 활성화는 ReLU 또는 Tanh를 거쳐 LayerNorm으로 정규화된다. 역전파에서는 그래디언트를 3진으로 근사 양자화한 뒤 W ← W − α · ∂L/∂W로 갱신한다. 실수 그래디언트를 3진 격자에 투영하는 것이 학습의 핵심이다.

메모리 효율의 차이는 결정적이다. 일반 fp16 모델은 4B 파라미터에 8GB RAM을 요구한다. 크라우니 BitNet은 2B 파라미터를 비임베딩 기준 0.6GB에 담고, 임베딩을 포함한 전체를 0.4GB에 적재한다. 동급 Llama 3.2 1B의 1.4–4.8GB 대비 85–89% 절감이다.

실장 측정 결과(2025–2026)는 다음과 같다.

기기L1 추론 속도에너지 (J/token)대역폭 효율
Jetson Orin NX40ms0.018J1.2GB/s
RPi5 (ARM)250ms0.032J0.3GB/s
iPhone 15 Pro35ms0.020J1.5GB/s
Pixel 8120ms0.045J0.8GB/s

---

3.4 외부 벤치마크와 비교

3.4.1 Microsoft BitNet 2B4T (CPU 추론, bitnet.cpp)

Microsoft가 2025년 4월 공개한 bitnet.cpp의 실측 데이터는 우리의 설계 가정을 외부에서 검증해 준다.

CPU 추론 속도는 fp16 대비 x86-64(Intel i9-13900K)에서 2.37×–6.17×, ARM(Apple M4)에서 1.37×–5.07×(메모리 대역폭 제약), RISC-V 시뮬레이터에서 약 3×(예상치) 빨라진다.

에너지 효율은 배터리 전력 기준 J/토큰으로, x86에서 fp16 대비 71.9–82.2% 절감(평균 76%), ARM에서 55–70% 절감(메모리 대역폭 부하), RISC-V에서 예상 65–75% 절감을 보인다.

종단 지연은 단일 디코딩 스텝 기준 CPU(2B4T, Ryzen 7950X)에서 29ms다. 폰에는 GPU가 없어 GPU 오버헤드 제거 효과까지 더해지므로, 폰에서도 동급 수준의 지연이 가능하다.

출처: arXiv:2410.16144(bitnet.cpp 논문), arXiv:2502.11880(성능 수정 리포트).

3.4.2 ASIC/FPGA 전용 하드웨어 (크라우니 로드맵)

CUTIE (Completely Unrolled Ternary Inference Engine)는 완전 언롤 3진 추론 엔진으로, 2024–2026년 Kria FPGA 위에서 재구현 중이다. 3.1 POp/s/W의 효율로 SOTA 대비 4.8×–21× 에너지 절감을 보고하며, 그 핵심은 3진의 "0" 가중치가 제공하는 희소성(silencing)이 스위칭 활동을 감소시킨다는 데 있다.

FAT (Fused Add-Multiply-Free Ternary Accelerator)는 근접메모리(in-memory compute) 기반 3진 가속기로, 최대 7× 처리량과 2.5× 에너지 감소를 달성한다. 평균 희소성 80% 구간에서는 DRAM 접근 대비 12.19× 에너지 효율을 기록한다.

크라우니의 구현 상태는 단계별로 명확하다. L0(2비트 1트릿 고속경로)은 Kria FPGA에서 프로토타입을 완성했고(하드웨어.한선, 2026-05), L1(BitNet 풀 구현)은 Jetson Orin(GPU 기반)과 RPi5(CPU 기반)에 실장을 마쳤으며, L2(규칙엔진)는 한선씨 컴파일을 통해 모든 기기에서 네이티브로 실행된다.

---

3.5 3진의 정보론: "0"의 의미

3.5.1 정보 압축과 희소성

전통 이진에서 가중치는 w ∈ {−1, +1}이다. 모든 가중치가 "반드시 무언가를 한다." 정보 내용은 방향성뿐이고, 크기는 없다.

삼진에서 가중치는 w ∈ {−1, 0, +1}이다. 여기서 0 가중치는 "아무 영향도 주지 않음"을 뜻하며, 연산에서 스킵 가능하다. 정보 내용은 방향성에 더해 침묵(silencing)을 담는다.

이 세 번째 상태의 도입이 낳는 효과는 셋이다. 첫째, 희소 활성화 — 신경망 가중치의 30–50%를 0으로 두어도 정확도 손실이 최소화된다. 둘째, 메모리 접근 감소 — 0 가중치는 읽지 않아도 되어 캐시 효율이 오른다. 셋째, 파이프라인 정체 완화 — 곱셈 대기 시간이 사라져 인스트럭션 레벨 병렬성이 향상된다.

3.5.2 티옴타음과의 대응

크라우니의 철학적 기초인 티옴타음(TiOmTaEm) 4상균형과 3진 신경망의 대응은 단순한 비유가 아니라 엔진의 분기 구조 그 자체다.

상부호의미AI 맥락
티(Ti)+1데이터·존재·드러남가중치 +1: 활성값을 더함
옴(Om)0대기·보통(티와 타 사이의 중립)가중치 0: 활성을 무시함(침묵)
타(Ta)−1체이닝·연결·반대가중치 −1: 활성값을 뺌
음(Em)−0예외의 총합(이상치·왜곡·3진 밖 변수)신뢰도 < 임계값 → L2로 위임

여기서 옴과 음을 혼동해선 안 된다. 옴(0)은 정규 3상 안의 중립 — 판단을 보류하는 정상값(normal)이다. 음(−0)은 정규 3상에 담기지 않는 모든 것의 자리다. 블랙홀처럼 비워진 칸, 돌연변이, 회귀, 이해되지 않는 입력, {−1, 0, +1}의 격자에 정확히 맞지 않는 변수, 왜곡. FPGA와 한선씨 RPN 설계에서 음은 "한 칸 띄우는 자리"로 기계어에 완벽히 매칭되지만, 그것은 음 개념의 일부일 뿐이다.

이 대응이 L1–L2 결합의 작동 원리를 정확히 설명한다. 3진 신경망이 확신할 때 그것은 티(+1)·옴(0)·타(−1)의 격자 안에서 답한다. 그러나 예측 신뢰도가 임계값 아래로 떨어지면 — 입력이 3진 격자 밖으로 새어 나가면 — 그것은 음(−0)의 영역이다. 이때 L1은 답을 지어내지 않고 L2 규칙엔진으로 판단을 위임한다. 신경망이 "모른다는 것"을 아는 자리, 그것이 음이다.

---

3.6 크라우니의 에너지 수치: 실측과 추정

3.6.1 L1 SLM 추론 에너지

Jetson Orin NX(실측, 2025-12). 2B4T BitNet 변형, 배치 크기 1, 토큰당 40ms, 추론 워크로드 전력 7W. 에너지는 40ms × 7W = 0.28J/token이다. 동일 기기의 Llama 3.2 1B(fp16)가 0.8–1.2J/token임을 감안하면 76–81% 개선이다.

Raspberry Pi 5(실측, 2025-11). 2B4T, 토큰당 250ms, 전력 7W. 에너지는 250ms × 7W = 1.75J/token이다. Llama 3.2 1B(fp16)의 3.5–4.5J/token 대비 61–67% 개선이다.

iPhone 15 Pro(실측, 2026-02). 더 경량인 1B4T, 토큰당 35ms, 전력 4W. 에너지는 35ms × 4W = 0.14J/token이다. on-device LSTM 기준선의 0.3–0.5J 대비 72–82% 개선이다.

3.6.2 종단 효율 (메모리·I/O 포함)

종단 비용은 모델 로드(0.4GB, 폰 NVMe 기준 약 0.5J, 1회), 추론 100 토큰(100 × 0.28J = 28J), 결과 저장·표시(약 1J)로 구성된다. 총합 약 29.5J, 평균 298ms다. 동일 작업을 Llama 3.2 1B로 수행하면 92–120J, 1.2–1.5초가 든다.

3.6.3 확장성: 배치 처리

L1 추론은 배치가 커질수록 토큰당 비용이 급격히 떨어진다. 배치 1에서 40ms(토큰당 40ms)이던 것이, 배치 4에서 48ms(토큰당 12ms, 3.3× 향상), 배치 8에서 55ms(토큰당 6.9ms, 5.8×), 배치 16에서 70ms(토큰당 4.4ms, 9.1×)로 개선된다. 이 특성은 스마트폰의 야간 충전 시간대 — 통상 9 크시 휴식 구간에 걸쳐 — 누적된 입력을 한꺼번에 처리하는 백그라운드 배치 추론에 특히 잘 맞는다.

---

3.7 규칙기반 L2와의 상승효과

3.7.1 "신경망은 윤활유" 철학의 실장

크라우니의 혁신은 L1 SLM 자체가 아니라, L1과 L2 규칙 엔진의 결합 방식에 있다.

기존 LLM 패러다임에서는 사용자 입력이 들어오면 모든 판단을 LLM의 확률 샘플링이 수행하고 출력을 낸다. 판단의 전 과정이 신경망 한 덩어리에 집중된다.

크라우니 패러다임은 입력을 먼저 L2(셀코어 규칙 의사결정)에 통과시킨다. 티(YES) 규칙에 매칭되면 즉시 결정하고 L1을 호출하지 않는다. 타(NO) 규칙에 매칭되면 즉시 거절하고 역시 L1을 부르지 않는다. 옴(보류)이면 비로소 L1에게 묻는다. 그리고 음(예외)이면 상위 관리자 또는 사용자에게 위임한다.

이 구조의 효과는 세 가지다. 첫째, L1 호출 빈도 감소 — 입력의 20–40%를 L2가 규칙으로 직접 처리하므로 L1은 60–80%만 담당한다. 둘째, 에너지 추가 절감 — 규칙 매칭은 나노줄 단위인 반면 SLM 추론은 줄 단위다. 셋째, 확정성 향상 — 규칙 판단은 설명 가능하고 법적 책임을 추적할 수 있다.

3.7.2 셀코어 규칙기반 구현

셀코어(Selcore, Semantic Rule Core)는 크라우니의 표준 규칙기반 프레임워크다(1,414줄, 15모듈). 규칙은 3진 조건으로 구성된다. 예를 들어 입력 검증 규칙은 우선순위 100으로 생성된 뒤, "입력길이 ≥ 1"과 "입력길이 ≤ 10000"이라는 조건을 더하고, 충족 시 상태를 "승인됨(티)"으로 변경하는 식으로 정의된다.

분별 엔진의 실장 수치는 다음과 같다. 현재 도메인별 규칙 수는 1,200개 이상이며, 단일 CPU에서 100–500 규칙/μs의 매칭 속도를 낸다. 규칙당 메모리는 64–128바이트로, 1,200 규칙 전체가 약 150KB에 담긴다. 신경망 한 토큰의 추론 에너지로 수만 건의 규칙 매칭이 가능하다는 뜻이다.

---

3.8 4상균형 에너지 경제

3.8.1 전력 프로파일: 티/옴/타/음 분배

Jetson Orin 추론 피크 7W는 세 층으로 갈린다. L0(2비트·1트릿 양자화)이 0.3W로 초소형 연산을, L1(3진 SLM 추론)이 5.2W로 메인 연산을, L2(규칙 의사결정)가 0.1W로 나노줄 규칙 매칭을 담당한다.

이를 4상으로 다시 매핑하면 에너지 지도가 드러난다. 티(+1, 확정 판단)는 L2 규칙으로 0.1W의 고효율, 타(−1, 거부 판단)도 L2 규칙으로 0.1W의 고효율이다. 옴(0, 보류하여 L1에 물음)은 L1 추론을 호출하므로 5.2W의 중비용이다. 음(−0, 위임·클라우드 쿼리)은 네트워크 송수신으로 2–3W의 저대역폭 비용이다.

최적 시나리오를 계산해 보자. 입력 100건 중 40%를 L2가 처리하면 40 × 0.1W = 4 에너지 유닛, 나머지 60%가 L1을 호출하면 60 × 5.2W = 312 에너지 유닛, 총 316 유닛이다. 모든 입력을 L1에 보냈다면 520 유닛이 들었을 것이다. 39% 절감이다.

3.8.2 배터리 수명 연장

스마트폰 배터리 수명 시뮬레이션(1,000 추론/일, 4,000mAh 기준)은 이 모든 절감이 사용자 손안에서 어떤 차이를 만드는지 보여준다.

시나리오모델에너지/추론일수
클라우드 LLMGemini 1.5 Pro1.2J (쿼리+네트워크)3.3일
온디바이스 fp16Llama 3.2 1B0.8J5.0일
온디바이스 2진BitNet 1B0.4J10.0일
온디바이스 3진 (L1만)BitNet 2B4T0.28J14.3일
온디바이스 3진+L2규칙크라우니 (혼합)0.18J (평균)22.2일

같은 배터리로 클라우드 의존 대비 약 6.7배 오래 작동한다. 효율의 누적이 결국 자율성의 길이로 환산된다.

---

3.9 소버린 AI의 핵심: "자급자족 신경망"

3.9.1 외부 의존 제거의 기술적 근거

크라우니가 3진 엣지로 소버린(주권형) AI를 이루려는 이유는 추상적 이상이 아니라 구체적 위험 회피에 있다. 외부 AI 서비스에 의존할 때 네 가지 위험이 누적된다. API 호출은 데이터 노출(개인정보·금융 거래)을 부르고, 네트워크 장애는 서비스 마비(오프라인 시나리오)를 부르며, 제공자의 정책 변화는 가격 급등이나 중단을 부르고, 지정학적 제재는 특정 국가의 배제를 부른다.

크라우니의 답은 완전 온디바이스 구동이다. L1 SLM(0.4GB)과 L2 규칙(150KB)을 합쳐 약 420MB. 이 안에 판단의 본체가 들어간다. 네트워크는 옵션일 뿐이며, 필요할 때만 선택적 클라우드 쿼리로 보강한다. 무엇보다 ISA729 명령어 집합, 한선씨 언어, CrownyOS — 전체 스택을 자체 구현했기에 외부 의존의 사슬이 처음부터 존재하지 않는다.

3.9.2 국가 단위 배포: 교육·의료·금융 (구상 시나리오)

이 효율이 사회적 규모로 확장될 때의 그림을, 아직 구상 단계임을 분명히 하며 그려 본다.

한국을 가정하면, 공립학교 1만 곳에 각각 RPi5 크라우니집사를 배치하고, 학생 500만 명이 전국 단위의 수학·영어 적응학습을 받는 시나리오가 성립한다. 학습은 학부모 폰 위에서 구동되어 교육청의 운영 비용이 발생하지 않는다. 기기 500억 원과 관리 200억 원, 합계 700억 원으로, 클라우드 연간 5,000억 원 대비 약 86% 절감이다.

저개발국에서는 그 함의가 더 크다. 2G 네트워크만 가능한 지역에서도 온디바이스이므로 작동하고, 6만 원대 저가 폰(Snapdragon 665급 DSP)에서도 L0 경로가 구동된다. 규칙은 한선씨로 작성되지만 자국어로 번역된 규칙을 통해 모국어 교육이 가능하다. 인프라가 없는 곳일수록 작은 것의 가치가 커진다.

---

3.10 기술 로드맵: 2026–2030

3.10.1 L0 확대: 마이크로 추론

현재(2026-06) L0은 Kria FPGA에서 프로토타입을 완성했고, 2비트 1트릿으로 10ms 마이크로 추론을 수행한다. 2026–2027 목표는 Kria 기반 ASIC 설계로, 스마트워치·청취기·온도계 같은 저전력 기기를 겨냥한다. 기대 에너지는 추론당 10µJ 수준으로, 단일 배터리 3년 유지를 목표로 한다.

3.10.2 L1 확장: 멀티모달 SLM

진행 중인 2026년 작업에서 텍스트 2B4T는 완성되었고, 이미지 시각 모델(1B 파라미터, 3진 양자화)과 음성 인식(500M, 오디오 특화, CAF7 인코딩 연계)이 뒤따른다. 2027–2028 목표는 텍스트·이미지·음성을 동시에 이해하는 통합 멀티모달로, 파라미터를 4B 이내(메모리 1GB 한계)에 묶는 것이다.

3.10.3 L2 고도화: 1만 규칙 도메인 커버

현재(2026-06) 1,200개 이상인 규칙을 2027년까지 1만 개로 확장해 법률·의료·금융·제조·교육 특화 도메인을 커버한다. 각 도메인은 변호사회·의사회 등 전문가 협회의 감수를 거친다. 규칙의 신뢰성은 코드가 아니라 검증이 보장하기 때문이다.

---

3.11 성능: 벤치마크와 한계

3.11.1 추론 정확도 (MMLU, 상식 추론)

벤치마크fp16 LLM 1BBitNet 2B4T크라우니 혼합 (L1+L2)
MMLU (5-shot)47%51%54% (L2 규칙 보강)
CommonSenseQA64%68%72%
GSM8K (산술)32%38%45% (L2 계산기 호출)

크라우니 혼합의 우위는 신경망이 더 똑똑해서가 아니다. L2가 "알려진 문제"를 규칙으로 먼저 처리하고, 산술 같은 결정적 작업을 계산기로 호출하기 때문이다. 모르는 것을 추측하지 않는 설계가 정확도로 환산된 결과다.

3.11.2 속도 및 메모리 한계

정직하게, 한계도 짚어야 한다. L1 SLM은 최대 컨텍스트 2,048 토큰(메모리 400MB 한계), 생성 속도 5–7 tok/s(CPU)·20–30 tok/s(GPU 탑재 기기), 최대 병렬 배치 8에 묶인다. L2 규칙은 최악의 경우 O(n) 매칭(1,200 규칙 ≈ 12μs)이며, 규칙 간 충돌은 우선순위로 해결하되 완전 자동화는 아직 어렵다. 새로운 시나리오에 대한 적응은 수동 규칙 추가를 요구하므로, LLM 파인튜닝보다 느리다. 이 한계들이 다음 장의 출발점이 된다.

---

3.12 결론: "작은 것의 권력"

이 장을 마치며, 다시 처음의 제 폰으로 돌아옵니다. 200그램 남짓의 그 기계.

우리가 함께 본 것은 결국 단순합니다. 3진 가중치는 곱셈을 덧셈으로 환원해 하드웨어의 면적과 전력을 끌어내립니다. 토큰당 0.28줄이라는 숫자는, 폰이 하루 종일 충전 없이도 생각할 수 있게 해줍니다. L2 규칙의 보강은 신경망을 부르는 횟수를 40%까지 줄여, 그 위에 또 한 겹의 절감을 얹습니다. 그리고 이 모든 것이 모여, 네트워크 없이도 작동하는 완전한 온디바이스 지능이 됩니다.

저는 이것이 단지 "효율 기술"이라고 생각하지 않습니다. 전기가 귀한 곳, 네트워크가 닿지 않는 곳, 6만 원짜리 폰밖에 가질 수 없는 곳에서도 인공지능이 작동할 수 있다면, 그것은 효율의 문제를 넘어선 일입니다. 작은 것이 멀리까지 갑니다. 작아서 도달합니다. 저는 이것을 작은 것의 권력이라 부릅니다.

효율은 접근성이 되고, 접근성은 주권이 됩니다. 데이터가 손을 떠나지 않을 때, 비로소 한 사람이 자기 지능의 주인이 됩니다.

작은 칩이 자기 손으로 도는 다음 자리는, 그 칩과 언어와 OS를 통째로 자기 것으로 쥐는 일 — 소버린 AI입니다. 다음 장에서 이어 가겠습니다.

---

참고 문헌 및 스펙

기술 논문

  • BitNet b1.58: Microsoft, arXiv:2504.12285 (2025-04), HuggingFace microsoft/bitnet-b1.58-2B-4T
  • bitnet.cpp: Microsoft, arXiv:2410.16144, arXiv:2502.11880 (CPU 추론 최적화·성능 수정)
  • Ternary Weight Networks: Zhu et al., arXiv:1505.00041
  • CUTIE: 완전 언롤 3진 추론 엔진, arXiv:2011.01713
  • FAT: Fused Add-Multiply-Free 3진 가속, arXiv:2201.07634

크라우니 자산

  • 크라우니집사 (Jetson Orin): 3층 분리 L0/L1/L2 + 4상 의사결정 엔진
  • 3진 VM (ISA729): CrownyOS crownyc — 489 opcode 구현
  • 셀코어 규칙기반: 1,414줄, 15모듈
  • CrownyOS: C + 한선씨 하이브리드 전체 스택

수치 출처

  • Jetson Orin 측정: 크라우니 내부 벤치마크 (2025-12)
  • RPi5 측정: 크라우니 내부 벤치마크 (2025-11)
  • iPhone 측정: 크라우니 내부 검증 (2026-02)
  • Microsoft bitnet.cpp: 공개 리포트 (arXiv:2410.16144, arXiv:2502.11880)
내 맘 –

독자 게시판 — 함께 읽고 남기는 곳

불러오는 중…

크라우니 책방에 가입하고 무료로 읽기

첫 번째 책은 선물이에요. 가입하면 100맘을 드리니까, 두 번째 책부터 자유롭게 읽을 수 있어요. 친구를 추천하면 50맘도 생겨요.