Fable 5.1 vs GPT-6 Astra
가장 이슈가 되고 있는 프론티어 AI 모델, Claude Fable 5.1과 OpenAI Astra, 그리고 Gemini 3.8 Flash까지 포함해서 각각의 사양과 가격, 전략적 차이를 분석 및 정리했습니다.
Sep 09, 2026
2026년 9월 1일 Anthropic이 Claude Fable 5.1을 출시했습니다. 다음 날 Google DeepMind가 Gemini 3.8 Flash와 보안 변형인 Flash Cyber를 출시했고, 9월 3일에는 OpenAI Astra(정식 명칭 GPT-6 Astra)의 출시가 시작됐습니다. 48시간 안에 세 프론티어 AI 모델이 쏟아진 것은 그간 전례가 없는 일입니다.
세 모델의 사양표만 놓고 보면 비슷한 점이 많습니다. 컨텍스트 윈도우가 1M 토큰 내외이고, 코딩 에이전트와 장시간 작업에 초점을 맞추고 있으며, 각각 고위험 능력에 대한 별도 접근 프로그램을 운영합니다. 그런데 실제 출시 내용을 들여다보면, 세 회사가 완전히 다른 관점에서 접근하고 있다는 것을 알 수 있습니다. Anthropic은 '어떻게 하면 더 저렴하게 최신 모델을 쓸 수 있는가', OpenAI는 '이 모델이 얼마나 위험한가', Google은 '하나의 모델로 두 시장에 진입할 수 있는가'를 묻고 있기 때문입니다.
사양 비교로 보는 세 모델
먼저 기술 사양을 한 표에 놓겠습니다.
항목 | Claude Fable 5.1 | OpenAI Astra | Gemini 3.8 Flash |
출시일 | 9월 1일 | 9월 3일 | 9월 2일 |
컨텍스트 윈도우 | 1M 토큰 | 1.05M 토큰 | 1M 토큰 |
최대 출력 | 128K 토큰 | 128K 토큰 | 64K 토큰 |
입력 가격 | $10 / MTok | $10 / MTok | $0.75 / MTok (프로모션) |
출력 가격 | $50 / MTok | $50 / MTok | $3.75 / MTok (프로모션) |
캐시 읽기 | $0.25 / MTok | $1.00 / MTok | 미공개 |
입출력 형식 | 텍스트, 이미지 → 텍스트 | 텍스트, 이미지 → 텍스트 | 텍스트, 이미지, 오디오, 비디오, PDF → 텍스트 |
사고 방식 | 적응형 (기본 High) | 비공개 | 3단계 (기본 Medium) |
학습 데이터 기준 | 2026년 6월 | 2026년 4월 | 미공개 |
특수 변형 | Mythos 5.1 (Glasswing) | Daybreak Blue | Flash Cyber (Fairwind) |
이 수치들에서 몇 가지가 바로 드러납니다.
Claude Fable 5.1과 OpenAI Astra는 입출력 가격이 $10/$50으로 동일합니다. 그런데 캐시 읽기에서 4배 차이가 납니다. Fable 5.1이 $0.25, Astra가 $1.00입니다. Gemini 3.8 Flash는 프로모션 기간(2026년 말까지) 기준으로 입력 $0.75, 출력 $3.75로 다른 두 모델의 13분의 1 수준입니다.
최대 출력에서는 Flash가 64K 토큰으로, 128K인 Fable 5.1과 Astra의 절반입니다. 입력 범위에서는 반대로 Flash가 가장 넓어서 오디오, 비디오, PDF까지 처리합니다.

Claude Fable 5.1, 가장 큰 변화는 성능이 아니라 가격
Claude Fable 5.1의 벤치마크 성적은 좋습니다. CursorBench 3.2.0에서 73.4%, Browserbase의 가장 어려운 난이도에서 82%를 기록했습니다. Anthropic은 이 모델을 '코딩과 지식 작업에서 세계에서 가장 앞선 모델'이라고 설명합니다.
그러나 이번 출시에서 실무 환경에 가장 직접적인 영향을 미치는 변화는 벤치마크가 아닙니다. 캐시 읽기 비용이 기존 $1.00에서 $0.25로 75% 내려갔습니다. 이전 Claude 모델들이 입력 가격의 10%를 캐시 읽기로 책정한 것에 비해, Fable 5.1은 2.5%입니다.
캐시 비용 인하가 중요한 이유는?
AI 코딩 에이전트는 한 세션 안에서 같은 코드베이스를 반복적으로 참조합니다. Anthropic의 자체 데이터에 따르면, Claude Code 세션의 78%가 여러 파일을 동시에 편집하는 멀티파일 작업입니다. 이런 워크로드에서는 전체 API 비용 중 캐시 읽기 비중이 높을 수밖에 없습니다.
20만 토큰 규모의 코드베이스를 컨텍스트에 두고 10번의 도구 호출을 수행하는 세션을 가정하면, 캐시 읽기량은 약 200만 토큰이 됩니다. Fable 5 기준으로 $2.00이던 것이 Fable 5.1에서는 $0.50이 됩니다. 하루 50세션, 한 달로 환산하면 $2,250의 차이입니다. 에이전트 운영 규모가 커질수록 이 격차는 빠르게 벌어집니다.

Anthropic은 또한 대화 중간에 노력 수준(effort)을 메시지 단위로 바꿀 수 있는 기능, 도구 호출 사이에 진행 상황을 실시간 스트리밍하는 기능, 콘텐츠 출처 추적(content provenance) 기능을 베타로 추가했습니다. 모두 장시간 에이전트 세션의 제어와 투명성을 높이는 방향입니다.
한 줄 요약: Fable 5.1은 '가장 강력한 모델을 더 싸게 돌릴 수 있게 만드는' 업데이트입니다.
OpenAI Astra, 가장 큰 변화는 'Critical'이라는 자기 선언입니다
OpenAI Astra의 가장 눈에 띄는 점은 벤치마크 점수가 아닙니다. OpenAI의 내부 위험 평가 체계인 Preparedness Framework에서 사이버 보안 항목 최고 등급 'Critical'을 받은 최초의 모델이라는 점입니다.
'Critical'은 모델이 인간의 단계별 지시 없이 고난도 보안 취약점을 독립적으로 식별하고 경화된 시스템에 대한 공격 코드를 자율적으로 작성할 수 있는 수준을 뜻합니다. 실제로 Astra는 알려진 취약점 공격 코드 작성 능력을 측정하는 ExploitBench에서 만점을 기록했고 2026년 6~8월에 공개된 고위험 취약점 20건을 대상으로 한 테스트에서 제로데이 2건을 자체 발견해 공격 체인에 활용했습니다.
이 결과가 논쟁적인 이유는 단순합니다. 취약점을 찾는 능력은 방어에도 쓰이지만 공격에도 직접 쓸 수 있기 때문입니다.
접근은 어떻게 제한되나?
OpenAI는 강화된 탈옥 방지, 계정 단위 위험 평가, 사고 과정 모니터링 등의 안전 장치를 적용했습니다. 가장 강력한 사이버 보안 기능은 Daybreak Blue라는 별도 프로그램을 통해서만 접근 가능합니다.
가격 구조에서도 특이한 점이 있습니다. 입력 토큰이 272K를 넘으면, 입력·캐시 요금이 2배, 출력 요금이 1.5배로 뜁니다. 대규모 코드베이스를 다루는 에이전트에서는 이 임계값을 쉽게 넘을 수 있어서 비용 예측이 어려워질 수 있습니다. Fable 5.1이 1M 토큰 전 구간에서 균일 요금을 적용하는 것과 대조적입니다.
한편, 미국의 기술 매체 TechCrunch 보도에 따르면 OpenAI의 안전성 주장에 대한 독립적 제3자 검증은 공개되지 않았습니다. OpenAI 출신 연구자는 '모델의 순응적 태도가 실제 안전성인지, 테스트 환경에 맞춘 행동인지' 의문을 제기했습니다.
범용 성능에서는 AI 모델 분석 플랫폼 Artificial Analysis의 종합 지수 기준 61.2점으로 이전 모델(GPT-5.6 Sol, 60.9점) 대비 소폭 상승했지만 OpenAI 스스로가 Fable 5.1이나 Claude Opus 5보다 낮다고 밝혔습니다. 대신 장문 컨텍스트 유지력은 최고 수준입니다. MRCR v2 벤치마크에서 512K까지 100%, 1M까지 96.3%의 검색 정확도를 보였습니다. 실제로 세 가지 모델의 업데이트 소식 이후, 소비자 반응 면에서 가장 폭발적인 호응을 불러일으키고 있는 모델이기도 합니다.
한 줄 요약: Astra는 '가장 강력한 창과 방패'와 같은 모델입니다.
Gemini 3.8 Flash, 가장 큰 변화는 하나의 모델에서 두 시장을 노린 것입니다
Gemini 3.8 Flash의 성격은 이름에 이미 드러납니다. Flash, 속도가 핵심입니다. 프로모션 가격 $0.75/$3.75는 같은 주에 나온 모델들의 13분의 1 수준이고 2027년 정상 가격($1.50/$7.50)으로 올라도 여전히 7분의 1 미만입니다.
Terminal-Bench 2.1에서 90.8%(이전 버전 대비 +9.2p), 금융 에이전트 벤치마크 τ³-bench Banking에서 38.1%(+7.2p)를 기록했습니다. 글로벌 법률 사무소 Harvey의 Legal Agent Benchmark와 Vals Finance Agent V2에서도 상위 성적을 거뒀습니다. 사고 수준은 Low, Medium, High 중 선택할 수 있고 기본값이 Medium이라는 점에서, 최고 성능보다 비용과 속도의 균형을 기본 설계로 잡고 있습니다.
Flash Cyber는 어떤 모델인가?
같은 날 출시된 Flash Cyber가 이 모델을 특별하게 만듭니다. 동일 기반 모델에서 파생됐지만 보안 사고 보고서, 취약점 데이터베이스, 악성코드 시그니처를 추가 학습했습니다. 핵심 원칙은 '방어 전용(defenders-only)'입니다. 20개 프로그래밍 언어에 걸쳐 취약점 발견율 70% 이상, CWE-Bench 패치 pass@1 47.2%를 기록했습니다.
Astra가 공격 능력까지 포함한 뒤 접근을 제한하는 방식이라면, Flash Cyber는 처음부터 능력 자체를 방어 방향으로 설계한 방식입니다. 같은 보안 AI인데 위험 관리 철학이 정반대입니다.
Flash Cyber는 Google의 Fairwind Program을 통해서만 접근 가능하고, 대상은 정부 기관, 핵심 인프라 운영자, 소프트웨어 유지보수 담당자로 제한됩니다.
한 줄 요약: Flash는 '가장 저렴하면서 보안 전용 변형까지 갖춘' 모델입니다.
세 모델이 공통으로 보여주는 변화
개별 모델을 넘어, 세 모델이 공통으로 드러내는 시장 변화가 세 가지 있습니다.
첫째, 성능 경쟁이 가격 경쟁으로 옮겨가고 있습니다. Fable 5.1은 캐시를 75% 인하했고, Flash는 기본 가격 자체를 $0.75까지 낮췄습니다. 같은 주에 출시된 Meta Muse Spark 1.3은 블렌딩 기준 약 $0.10입니다. 벤치마크 점수 차이는 줄어들고 있는데, 가격 차이는 오히려 벌어지고 있습니다.
둘째, 고위험 능력에 대한 차등 접근 구조의 표준화입니다. Anthropic의 Project Glasswing, OpenAI의 Daybreak Blue, Google의 Fairwind Program은 명칭은 다르지만 원칙은 같습니다. 검증된 사용자에게만 고위험 능력을 개방합니다. 세 회사가 독립적으로 같은 결론에 도달했다는 점은 이 방식이 앞으로 프론티어 모델 출시의 기본 패턴이 될 수 있음을 시사합니다.
셋째, 범용 모델과 특수목적 모델의 분리입니다. Fable과 Mythos, Flash와 Flash Cyber, Astra와 Daybreak Blue 버전. 같은 기반 모델에서 안전 장치의 수준만 달리해 여러 시장에 동시에 진입하는 구조가 세 회사 모두에서 나타나고 있습니다.

용도별 선택 기준
세 모델의 전략적 방향이 다른 만큼, 어떤 용도에 어떤 모델이 적합한지도 갈립니다.
용도 | 적합한 모델 | 이유 |
장시간 에이전트, 대규모 코드베이스 반복 참조 | Claude Fable 5.1 | 캐시 $0.25, 1M 전 구간 균일 요금, 128K 출력 |
보안 연구, 취약점 분석 (공격+방어) | OpenAI Astra (Daybreak Blue) | ExploitBench 만점, 제로데이 자체 발견 |
보안 연구, 취약점 분석 (방어 전용) | Gemini 3.8 Flash Cyber | 방어 전용 설계, 취약점 발견율 70%+, 낮은 비용 |
대량 호출, 비용 민감형 워크로드 | Gemini 3.8 Flash | 프로모션 $0.75, 멀티모달 입력 |
법률·금융 등 규제 산업 에이전트 | Gemini 3.8 Flash | Harvey Legal, Vals Finance 벤치마크 상위 |
장문 컨텍스트 분석 (500K+) | OpenAI Astra | MRCR v2 512K~1M 구간 96.3% (단, 272K 이후 2배 과금) |
멀티모달(오디오, 비디오, PDF) 처리 | Gemini 3.8 Flash | 5종 입력 지원 (다른 두 모델은 텍스트+이미지) |
이 표에서 한 가지가 눈에 들어옵니다. 모든 용도에서 최선인 모델이 없습니다. 각 모델이 서로 다른 축에서 강점을 보이고 있어 선택은 조직의 우선순위에 따라 달라질 수밖에 없습니다.
국내 기업이 가져갈 수 있는 것
국내 기업의 생성형 AI 도입률은 61%이지만, 전사 내재화 비율은 3.7%에 그칩니다. 미국의 경영 컨설팅 기업 McKinsey의 'State of AI 2026' 보고서에 따르면, 북미에서는 40%의 대기업이 에이전트를 하나 이상의 기능에서 본격 운영하고 있고 32%는 에이전틱 도구로 기존 소프트웨어 구매를 건너뛰었습니다.
국내에서도 이 흐름은 시작됐습니다. KT가 우리은행의 AI 챗봇을 에이전트 기반으로 전환하는 프로젝트를 수주한 사례가 있습니다.
이 맥락에서 세 모델의 출시는 국내 기업에 구체적인 의사결정 지점을 만듭니다.
비용 예측 가능성을 우선한다면, Fable 5.1의 캐시 구조가 참고 기준이 됩니다. 1M 토큰까지 균일 요금이기 때문에 에이전트 비용의 상한을 잡기 쉽습니다. 에이전트 파일럿을 낮은 비용으로 시작하고 싶다면, Flash의 프로모션 기간을 활용하되 2027년 정상 가격 기준으로 경제성을 미리 계산해두는 것이 안전합니다. 보안이 주요 고려 사항이라면, Astra의 Critical 등급과 Flash Cyber의 방어 전용 설계 사이에서 조직의 위험 관리 철학에 맞는 쪽을 선택해야 합니다.
세 회사의 고위험 접근 프로그램(Glasswing, Daybreak Blue, Fairwind)에 대해서는 국내 참여 경로가 아직 구체적으로 공개되지 않은 상태입니다. 관심이 있는 조직이라면 각사의 클라우드 파트너를 통해 사전에 문의해둘 필요가 있습니다.
앞으로 펼쳐질 경쟁의 판도
48시간 안에 나온 세 모델은 결국 하나의 질문으로 수렴합니다. 프론티어 모델의 성능이 비슷해진 다음, 경쟁은 어디서 일어나는가.
Claude Fable 5.1은 비용이라고 답했습니다. OpenAI Astra는 위험 관리라고 답했습니다. Gemini 3.8 Flash는 접근성이라고 답했습니다. 세 답이 모두 틀리지 않은 것은 AI 모델 시장이 단일 기준으로 순위를 매길 수 있는 단계를 지났기 때문일 수 있습니다.
이 분기가 영구적인지, 아니면 다시 하나의 축으로 수렴할지는 아직 알 수 없습니다. 다만 지금 시점에서 확인할 수 있는 것은, 모델을 선택하는 기준이 '가장 높은 점수'에서 '우리 조직에 맞는 방향'으로 바뀌고 있다는 점입니다. 세 모델 중 정답은 없지만, 우리 팀의 워크로드와 우선순위에 더 가까운 선택지는 분명히 있습니다.
참고 문헌
- Anthropic, 'Claude Fable 5.1 Overview', Claude Platform Docs, 2026-09-01
- OpenAI, 'Path to Astra: Critical Capabilities and Frontier Safeguards', 2026-09-01
- Google, 'Introducing Gemini 3.8 Flash and 3.8 Flash Cyber', Google AI Blog, 2026-09-02
- Artificial Analysis, 'GPT-6 Astra Intelligence, Performance & Price Analysis', 2026-09
- McKinsey, 'State of AI 2026', 2026-09
Share article