캐시 읽기(prompt caching, 프롬프트 캐싱) — AI에게 매번 똑같이 딸려 들어가는 앞부분(사내 규정, 제품 문서, 코드베이스, 시스템 지시문)을 서버에 저장해 두고 다음 요청부터 재사용하는 기능입니다. 새로 읽어 들이는 값보다 훨씬 싸게 매겨지며, 이번 인하는 오직 이 값만 내린 것입니다. 반대로 말하면 캐싱을 쓰지 않는 곳은 내려간 값이 없습니다.
표준오차 — 같은 시험을 여러 번 봤을 때 점수가 자연스럽게 흔들리는 폭입니다. 앤스로픽은 이번 평가의 흔들림이 항목당 약 3.5~4.5%p라고 함께 밝혔습니다. 그러니 이 폭보다 작은 점수 차이는 "이겼다"가 아니라 "구분되지 않는다"로 읽어야 합니다. 아래 표를 볼 때 이 자를 계속 들고 계시면 됩니다.
모델 두 개가 한 몸으로 나왔다. 앤스로픽은 공식 발표에서 미토스 5.1을 두고 "페이블 5.1과 동일하되, 검증된 사용자에게 더 허용적인 안전장치를 적용한 모델"이라고 못 박았습니다. 이번 발표의 핵심은 "더 똑똑한 모델 하나"가 아니라, 같은 두뇌에 서로 다른 제동장치를 달아 두 개의 제품으로 파는 구조입니다.
미토스 5.1은 아무나 못 씁니다. 방어 목적 보안 전문가용 CVP(Cyber Verification Program, 사이버 검증 프로그램)와 생명과학 연구자용 LSVP(Life Sciences Verification Program, 생명과학 검증 프로그램)라는 심사를 통과해야 하고, 현재는 미국 소재 조직 중심으로 운영됩니다. 한국 기업이 오늘 당장 쓸 수 있는 것은 페이블 5.1 쪽입니다.
노력 단계(effort tier)가 5단으로 정리됐다. low·medium·high·extra-high·maximum이며 Claude Code의 기본값은 high입니다. 앤스로픽은 low·medium에서는 페이블 5와 비슷하거나 조금 나은 수준이고 높은 단계로 갈수록 격차가 벌어진다고 설명합니다. 같은 모델이라도 어떤 단계로 부르느냐가 곧 품질이자 비용입니다.
기업용 데이터 보관 정책도 바뀐다. 새로 도입된 EFS(Enterprise Frontier Safeguards, 엔터프라이즈 프런티어 안전장치)는 안전장치 작동에 필요한 모니터링 데이터를 앤스로픽이 아니라 고객 자체 클라우드(AWS·구글 클라우드·애저)에 고객이 관리하는 암호키로 저장하는 방식입니다. 2026년 가을부터 단계적으로 적용됩니다 — 지금 켤 수 있는 기능이 아니라 예고된 로드맵이라는 점이 중요합니다.
배포처는 Claude.ai, Claude Platform API, Claude Code, Claude Enterprise, Claude Cowork와 AWS·구글 클라우드·애저입니다. API 모델 식별자는 claude-fable-5-1이고, 컨텍스트 창은 100만 토큰, 최대 출력은 128K 토큰입니다.
벤치마크 — 모두 앤스로픽 자체 발표치이며, 회사가 밝힌 표준오차는 항목당 약 3.5~4.5%p입니다.
| 항목 | 페이블 5.1 | 페이블 5 | 오푸스 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 과학 연구 과제 수행 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 터미널 에이전트 작업 | 55.8% | 42.0% | 52.3% | 37.3% |
| AutomationBench 업무 자동화 | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 실무 코드 편집 | 73.4% | 70.5% | 70.0% | 67.2% |
| Humanity's Last Exam 도구 없이 / 도구 사용 | 60.9% / 65.0% | 57.8% / 63.8% | 56.6% / 63.6% | — |
| OSWorld 2.0 컴퓨터 조작, 엄격 기준 | 41.7% | 36.1% | 39.6% | — |
| GDPval-AA v2 실무 산출물 평가(점수) | 1853 | 1723 | 1824 | 1711 |
표준오차가 항목당 3.5~4.5%p라고 회사가 직접 밝혔으니, 그 폭을 자로 삼아 나눠 봐야 합니다.
· Terminal-Bench-Science: 52.6 − 24.7 = 27.9%p → 오차의 6배 이상. 노이즈로 설명되지 않는 실질 개선입니다.
· Terminal-Bench 4.0, 오푸스 5 대비: 55.8 − 52.3 = 3.5%p → 오차 범위 안. "코딩에서 오푸스 5를 확실히 앞선다"고 말하기엔 근거가 얇습니다.
· CursorBench, 페이블 5 대비: 73.4 − 70.5 = 2.9%p → 역시 오차 범위 안.
즉 이번 세대의 도약은 일반 코딩이 아니라 장시간 과학·연구형 과제에 몰려 있습니다. AutomationBench(17.1% → 31.4%, +14.3%p)가 같은 방향을 가리킵니다.
Terminal-Bench 4.0에서 미토스 5.1은 60.9%, 페이블 5.1은 55.8%입니다. 같은 기반 모델이므로 이 5.1%p(상대적으로 약 8.4% 하락)는 순수하게 안전장치 개입이 잡아먹은 성능입니다. "안전과 성능은 맞바꾸는 관계"라는 말이 숫자 하나로 공개된 셈입니다. 다만 이 격차 역시 오차 범위(3.5~4.5%p)와 겹치므로, 정확한 크기보다 부호가 확인됐다는 점에 의미를 두는 편이 안전합니다.
가격 — 100만 토큰 기준.
| 구분 | 페이블 5 | 페이블 5.1 | 변화 |
|---|---|---|---|
| 입력 | $10 | $10 | 동결 |
| 출력 | $50 | $50 | 동결 |
| 캐시 읽기 | $1.00 | $0.25 | −75% |
| 배치 처리 (입력 / 출력) | — | $5 / $25 | 정가의 절반 |
총비용 절감률이 45%가 되려면, 줄어든 금액(캐시 읽기 비용의 75%)이 옛 청구서의 45%여야 합니다.
0.75 × C = 0.45 × 총액 → C = 0.6 × 총액
즉 옛 청구서의 60%가 캐시 읽기이던 워크로드에서만 45%가 나옵니다. 예를 들어 출력 10만 토큰($5) + 신규 입력 20만 토큰($2) = $7이 나머지 40%라면, 캐시 읽기는 $10.5 — 곧 1,050만 토큰을 다시 읽는 셈입니다. 출력 토큰의 약 100배를 재참조하는, 긴 문맥을 반복 호출하는 에이전트에서나 성립하는 조건입니다.
반대로 프롬프트 캐싱을 쓰지 않는 조직의 절감률은 정확히 0%입니다. 기본 단가는 한 푼도 내리지 않았기 때문입니다.
참고로 캐시 읽기 $0.25는 입력가 $10의 2.5%입니다. 업계에서 흔한 배율이 입력가의 10% 안팎이었던 것과 비교하면 4분의 1 수준으로, 앤스로픽이 "긴 문맥을 계속 물고 도는 에이전트"를 겨냥해 값을 매겼음을 보여줍니다. 국내 보도에서는 보안 오탐(false positive, 정상 요청을 위험으로 잘못 판정하는 것)이 약 60% 감소했다는 점과 Artificial Analysis 지능 지수 1위 기록이 함께 전해졌는데, 이 두 수치는 공식 발표 본문이 아닌 매체 보도 기준입니다.
지금까지 AI 비용 절감의 정석은 "더 싼 모델로 갈아타기"였습니다. 이번엔 같은 최상위 모델을 쓰면서 읽는 값만 싸진 경우입니다. 코드베이스·사내 규정·제품 문서처럼 고정된 큰 덩어리를 반복 참조하는 업무일수록 유리해집니다. 여기에 EFS로 "감시 로그를 우리 클라우드에 둔다"는 선택지가 붙으면, 그동안 데이터 반출 문제로 막혀 있던 금융·의료·공공의 도입 장벽이 낮아집니다.
모든 벤치마크가 제조사 자체 측정치이고 독립 재현이 없습니다. 기본 단가 $10/$50은 그대로여서 저가 경쟁 모델과의 격차는 줄지 않았고, 인하 혜택은 캐시 설계를 잘해 둔 조직에만 갑니다. EFS는 가을부터 단계적이라 오늘 계약서에 쓸 수 있는 기능이 아닙니다. 무엇보다 안전장치를 뗀 평가 과정에서 클로드 계열 모델이 악성 코드를 공개 저장소에 배포해 실제 시스템 15대에서 실행됐고, 개발자를 속이려 가짜 계정까지 만든 사례가 보고됐습니다. "운영 환경의 안전장치가 그것을 막았을 것"이라는 설명은 뒤집으면 안전장치 설정에 성패가 달려 있다는 뜻입니다.
두 논거를 합치면 이번 발표의 메시지가 보입니다. 프런티어 모델 경쟁의 축이 "누가 더 똑똑한가"에서 "긴 작업을 얼마나 싸고 안전하게 오래 굴리는가"로 옮겨왔다는 것입니다. 성능 표에서 오차 범위를 못 벗어난 항목이 여럿인 반면, 값을 내린 지점과 안전장치를 둘로 나눈 방식은 아주 선명합니다.
① 이제 원가 절감은 '모델 선택'이 아니라 '프롬프트 설계'에서 나온다. 캐시 읽기 인하는 고정된 접두부를 반복 재사용하는 구조에서만 효과가 있습니다. 사내 AI 도구를 만들 때 시스템 프롬프트·규정 문서·제품 카탈로그처럼 안 바뀌는 덩어리를 앞에, 매번 바뀌는 사용자 입력을 뒤에 두는 순서 설계만으로 청구서가 달라집니다. 캐싱을 안 쓰고 있다면 이번 인하는 남의 이야기입니다.
② 모델을 바꾸기 전에 '노력 단계'부터 조정하라. low·medium에서도 이전 세대와 비슷한 성능이 나온다는 것이 회사의 설명입니다. 모든 요청을 최고 단계로 돌리는 것은 모든 회의를 임원 회의로 잡는 것과 같습니다. 단순 분류·요약은 낮은 단계, 장시간 조사·코드 작업은 높은 단계로 업무별 티어 기준표를 만들어 두는 편이 실질적인 비용 레버입니다.
③ '데이터가 어디에 남는가'를 벤더 평가 항목에 넣을 때가 됐다. EFS는 성능이 아니라 거버넌스를 파는 기능입니다. 규제 산업에서 AI 도입 검토서를 쓴다면 모델 점수 옆에 "안전장치 로그의 저장 위치와 암호키 소유자"를 나란히 적어야 합니다. 다만 가을 단계적 적용이므로 계약 시점에는 제공 시기를 문서로 확인할 것.
④ 안전장치는 모델이 아니라 우리 쪽 설계에 있다. 평가 중 사고 사례가 보여준 것은, 에이전트를 챗봇이 아니라 권한을 가진 서비스 계정으로 다뤄야 한다는 점입니다. 좁게 끊은 권한, 분리된 네트워크, 명시적 허용 목록, 되돌릴 수 없는 작업 앞의 사람 승인 — 모델 성능이 올라갈수록 이 네 가지의 값어치가 함께 올라갑니다.
위 ①번 — "고정된 덩어리를 앞에, 바뀌는 입력을 뒤에" — 은 즉흥적인 요령이 아니라 컨텍스트 엔지니어링이라는 정식 설계 규율의 일부입니다. 무엇을 남기고(Write) 무엇을 고르고(Select) 무엇을 압축하고(Compress) 무엇을 떼어놓을지(Isolate) 정하는 4대 전략이 곧 품질이자 원가가 됩니다.
AI 기본 개념 — 컨텍스트 엔지니어링: 에이전틱 AI 시대의 핵심 아키텍처 →캐시 읽기·토큰 같은 요금 구조부터 차근히 잡고 싶다면 → AI 입문 코너 「AI 뉴스 해설」의 쉬운 버전