연구

환각을 0으로 미는 방법은 행동 교정이 아니라 지식 공급이었습니다.

8×H100에서 60일. 개방형 LLM이 CNC 현장 옆에서 3초 안에, 근거를 달아, 모르면 거절하는 가공 코파일럿이 될 수 있는지 측정했습니다.

프로그램
NVIDIA Innovation Lab · 2026-05-12 → 2026-07-11 (60일)
클러스터
8×H100 SXM5 80GB NVLink
리포트
TR-2026-01 · 2026-07-13
도메인
CNC / NC 코드 · 컨트롤러 7종
01 — 요약

폐쇄형 4–10% 천장에서 실시간 89.9% 근거 정답으로.

현장에서 돌아가는 기계 옆의 LLM은 일반 어시스턴트보다 엄격한 계약을 져야 합니다. 근거 없는 이송·회전수·알람·고정싸이클 답변 하나가 물리적 파손으로 이어지므로, 틀린 답은 거절보다 명백히 나쁩니다. 그래서 우리는 정답률과 함께 거짓답변률을 1급 지표로 측정했습니다.

89.9

72B-FP8 근거 정답 (100점 만점)

1.73s

72B-FP8 p99 지연 (TP4, CUDA graph)

4.8%

72B 거짓답변률

−81pt

8B 환각 감소 (SFT 90.5% → RAFT 9.5%)

1.5%

미공개 홀드아웃 환각률 (n=200)

220,813

RAFT 코퍼스 행 (v3, 전량 인용부착)

02 — 진단

숫자가 아니라 진단이 결론입니다.

첫 4주 동안 쫓던 잔여 환각은 행동 문제가 아니라 지식 문제였습니다. 사실이 애초에 가중치 안에 없었던 것입니다.

그래서 폐쇄형(closed-book) LoRA 어댑터 457개를 학습시켜도 함정 세트 정답률은 100점 만점에 4–10점의 모수적 천장을 넘지 못했습니다. 행동을 아무리 교정해도 없는 지식은 만들어지지 않습니다.

RAFT(Retrieval-Augmented Fine-Tuning)는 제품이 서비스하는 방식 그대로 학습시킵니다 — 추론 시점에 검증된 지식베이스가 문서를 공급하고, 모델은 읽고 → 근거를 대고 → 인용하고, 아니면 거절하는 법을 배웁니다. 이 천장은 모든 규모(8B·32B·72B)에서 무너졌습니다.

03 — 방법

읽고 · 근거 대고 · 인용하고 · 아니면 거절한다.

01

인용 부착 코퍼스

컨트롤러 매뉴얼·알람 사전·절삭 데이터를 220,813행으로 정규화하고 모든 행에 출처를 부착했습니다.

02

RAFT 학습

Qwen 계열 8B·32B·72B를 검색 결과와 함께 학습시켜, 문서가 있을 때는 인용하고 없을 때는 거절하도록 만들었습니다.

03

FP8 양자화

오프라인 per-channel FP8(W8A8)로 72B 계층을 실시간 구간에 올렸습니다. 품질 손실은 측정되지 않았습니다.

04

검색 신뢰도 게이트

가중치 안의 거절 능력은 무학습 비율과 무관하게 60% 부근에서 포화합니다. 그래서 생성 앞단에 검색 신뢰도 게이트를 두어 운영 환각을 0으로 밀었습니다.

04 — 결과

모든 규모에서 천장이 무너졌습니다.

동일 베이스 모델, 동일 비용. 달라진 것은 추론 시점에 지식이 공급되는가뿐입니다.

구성정답 (100점)거짓답변률비고
폐쇄형 LoRA (457개 어댑터)4 – 10모수적 천장, 돌파 실패
8B · SFT59.790.5%유창하지만 근거 없음
8B · RAFT75.29.5%비용 동일, 환각 −81pt
32B · RAFT1.5%홀드아웃 n=200, 정확 거절 98.5%
72B · RAFT (FP8)88.4 – 89.94.8%출처 근거 100%

홀드아웃 평가는 학습에서 완전히 제외한 알람 분포(n=200)로 수행했습니다. 거짓답변이 1.5%까지 떨어지고 정확 거절이 98.5%에 이른 것은 암기가 아니라 읽고-근거대고-인용하고-아니면-거절하는 행동을 학습했다는 증거입니다.

05 — 서빙

실시간 구간에 올린 72B.

정확도가 현장에서 의미를 가지려면 기계 옆에서 기다릴 수 있는 시간 안에 나와야 합니다. 오프라인 per-channel FP8(W8A8)은 품질 손실 없이 72B 계층을 실시간 봉투 안에 넣었습니다.

p99 1.73초

TP4 + CUDA graph 기준. 32B RAFT는 52토큰 응답에서 p99 1.1초.

GPU당 약 18GiB

서빙 비용 약 13배 절감. 온프레미스 단일 노드에 들어갑니다.

per-tensor 동적 FP8은 실패

같은 FP8이라도 per-tensor 동적 방식은 출력이 붕괴했습니다. 양자화 방식은 선택이 아니라 설계입니다.

06 — 운영

거절은 가중치가 아니라 게이트가 보장합니다.

학습만으로 만든 거절 능력은 무학습 데이터 비율을 아무리 조정해도 60% 근처에서 포화했습니다. 그래서 제품에서는 생성 이전에 검색 신뢰도를 먼저 판정합니다. 근거 문서가 기준을 넘지 못하면 모델은 답을 만들지 않고 사용자에게 그대로 알립니다 — 이것이 DION AI가 현장에서 지키는 계약입니다.

현장에서 직접 확인하세요.

지금 가공하시는 부품과 컨트롤러로 같은 질문을 던져보시면 됩니다.

기술 리포트 PDF 내려받기

U2DIA AI Research (Suyong Yun). Retrieval-Augmented Fine-Tuning Bypasses the Parametric Knowledge Ceiling: Benchmarking Zero-Hallucination Machining-Copilot LLMs on 8×H100. Technical Report TR-2026-01, 2026-07-13.