읽을거리 · AI 디자인

Claude Fable 5.1 vs GPT-6 아스트라, 숫자로 비교해 보면

이틀 차이로 나온 두 최상위 모델. 공식 사양, 제3자 평가, 디자이너들의 초기 반응을 출처와 함께 나란히 놓았다.

· 읽는 데 약 4분

9월 첫 주, 최상위 AI 모델 두 개가 이틀 간격으로 나왔다. 앤트로픽의 Claude Fable 5.1이 9월 1~2일, 오픈AI의 GPT-6 아스트라가 9월 3일이다. 둘 다 자기가 가장 똑똑하다고 발표했고, 공교롭게 가격표까지 같다.

어느 쪽이 낫냐고 물으면 한 줄로 답하기가 어렵다. 공식 사양, 독립 기관의 평가, 먼저 써 본 사람들의 반응을 차례로 놓고 보면 왜 그런지 보인다.

먼저 밝혀 둘 것. 벤치마크 가운데 상당수는 모델을 만든 회사가 직접 잰 수치다. 누가 잰 숫자인지 표마다 적었다. 참고로 나는 이 사이트를 클로드 코드로 만들고 있어서, 그만큼 출처가 있는 숫자만 옮겼다. 모든 수치는 2026년 9월 중순 기준이고 빠르게 바뀐다.

사양: 가격은 같고, 캐시가 다르다

Claude Fable 5.1GPT-6 아스트라
공개2026년 9월 1~2일2026년 9월 3일
입력 가격 (100만 토큰)$10$10
출력 가격 (100만 토큰)$50$50
캐시 읽기 (100만 토큰)$0.25$1
한 번에 읽는 분량100만 토큰105만 토큰
한 번에 쓰는 분량12.8만 토큰12.8만 토큰
지식 기준 시점2026년 6월2026년 4월

출처: 앤트로픽 모델 문서, 오픈AI 모델 문서. 굵은 글씨가 유리한 쪽.

표만 보면 거의 쌍둥이다. 차이는 두 군데다.

같은 긴 자료를 되풀이해 읽히는 작업이라면 이야기가 달라진다. 한 번 읽은 내용을 다시 불러올 때 내는 캐시 요금이 Fable 5.1은 아스트라의 4분의 1이다. 브랜드 가이드 PDF를 붙여 두고 몇십 번씩 질문하는 식의 작업이 여기에 해당한다. 그리고 Fable 5.1이 두 달 더 최근까지 알고 있다.

속도는 공식적으로 비교할 숫자가 없다. 앤트로픽은 Fable 5.1을 자사 모델 가운데 "느린 편"으로 분류한다.

종합 점수는 같은데, 비용은 두 배 넘게

독립 평가 기관인 Artificial Analysis의 종합 지수(9월 9일, v4.3)에서 두 모델은 나란히 53점, 공동 1위다. 코딩 에이전트 지수도 62점으로 같다.

차이는 같은 점수를 내는 데 든 비용에서 난다. 지수 과제 하나를 푸는 데 평균 Fable 5.1은 7.63달러, 아스트라는 3.26달러를 썼다. 토큰 가격이 같은데 비용이 다른 이유는 말의 양이다. 과제 하나에 Fable 5.1은 출력 토큰을 약 7만 8천 개, 아스트라는 약 2만 7천 개 썼다.

같은 점수를 내는 데 든 비용과 말의 양. 막대가 짧을수록 적게 썼다는 뜻이다.
같은 점수를 내는 데 든 비용과 말의 양. 막대가 짧을수록 적게 썼다는 뜻이다.

한 가지 조심할 점이 있다. 이 지수는 아스트라가 나온 뒤 일주일 사이에 두 번 개편됐고, 그 사이 아스트라는 5위에서 1위로 올라왔다. 아직 자리 잡은 숫자라고 보기는 이르다.

일의 종류가 바뀌면 순위도 바뀐다

평가무엇을 재나Fable 5.1아스트라누가 쟀나
Code Arena: WebDev웹앱을 만들게 하고 사람이 둘 중 고름1758점 (2위)1800점 (1위)Arena 사용자 투표
Agent Arena도구를 써서 하는 긴 작업1위2위Arena 사용자 투표
Design Arena 3D3D 장면 만들기1423점 (3위)1481점 (1위)Design Arena 사용자 투표
Terminal-Bench 4.0터미널에서 하는 코딩 작업55.8%57.7%오픈AI 발표
DeepSWE v1.1긴 호흡의 실제 개발 과제67.4%74.1%오픈AI 발표
인류의 마지막 시험 (도구 사용)전문가 수준의 문제65.0%57.2%오픈AI 발표

출처: Runtime Wire (Arena, 9월 9~13일), Better Stack (Design Arena), Vellum (오픈AI 발표 표).

웹 화면을 만드는 대결에서는 아스트라가 앞서고, 도구를 오래 쓰는 에이전트 대결에서는 Fable 5.1이 앞선다. 사람이 직접 고르는 투표형 평가에서도 결과가 이렇게 갈린다.

눈여겨볼 줄은 맨 아래다. 오픈AI가 직접 낸 발표 표인데도 전문가 수준 문제에서는 Fable 5.1이 더 높게 나와 있다.

두 회사가 서로 다른 시험을 골라 발표한다는 점도 알아 두면 좋다. 앤트로픽은 Fable 5.1의 SWE-bench Pro 점수를 81.2%로 냈지만, 오픈AI는 아스트라의 같은 점수를 내지 않았다. 같은 시험 점수가 나란히 놓인 경우가 생각보다 적다.

디자이너들의 반응

오픈AI는 아스트라를 소개하면서 프런트엔드 디자인의 시각적 판단력을 앞세웠다. 스케치나 레퍼런스를 주면 동작하는 화면으로 옮기고 레이아웃, 타이포그래피, 간격을 다듬는다는 설명이다.

먼저 써 본 디자이너들의 평은 한쪽으로 쏠리지 않는다. 한 비교 글(Eidos Design, 9월 7일)은 이렇게 정리했다.

  • 아스트라: 첫 초안이 이미 완성품에 가깝다. 레이어와 공간을 잘 다루고 3D·CAD에 강하다. 대신 덜어 내야 할 때 더하는 버릇이 있어 화면을 과하게 채우고, 틀릴 때도 자신 있게 틀린다.
  • Fable 5.1: 절제된 쪽이라 실제로 내보낼 화면으로 다듬는 데 낫다. 대신 과감함이 부족해 손을 한 번 더 봐야 한다.
  • 둘 다: 진짜 취향은 없다.

다섯 가지 디자인 과제를 나눠 시켜 본 비교(Better Stack, 9월 14일)도 결론이 비슷하다. 웹 디자인은 오히려 Kimi K3가 가장 나았고, 3D는 아스트라, 2D 게임은 Fable 5.1이 이겼다. UI 컴포넌트는 셋이 비슷했고, 모바일 앱 디자인은 셋 다 그대로 쓸 수준이 아니었다.

하나 더 있다. Artificial Analysis는 발표 자료 같은 문서의 완성도를 재는 항목에서 아스트라가 이전 모델인 GPT-5.6 Sol보다 오히려 낮게 나왔다고 적었다. 슬라이드를 많이 만드는 사람이라면 참고할 만하다.

정리하면

가격표는 같지만 실제 비용은 쓰는 방식에 따라 갈린다. 긴 자료를 붙여 두고 여러 번 묻는 작업은 캐시가 싼 Fable 5.1이, 짧게 한 번에 답을 받는 작업은 말수가 적은 아스트라가 유리하다.

평가에서는 웹 화면과 3D를 빠르게 뽑는 쪽은 아스트라가, 도구를 오래 쓰는 긴 작업은 Fable 5.1이 앞선다. 먼저 써 본 디자이너들이 권하는 방식도 이 결과와 맞닿아 있다. 첫 탐색은 아스트라로, 다듬는 마무리는 Fable 5.1로.

그리고 둘 다 나온 지 한 달이 안 된 모델이다. 순위는 몇 주 안에 또 바뀔 수 있다. 결국 내 작업에 맞는지는 내 작업으로 한 번 돌려 봐야 안다.

AI 툴은 종류별로 AI 디자인 툴에 모아 두었다. 어떤 도구든 작업 흐름 어디에 끼워 넣을지는 AI가 시안을 서른 장 뽑아 줘도 일이 줄지 않는 이유에 따로 적었다.

다른 글

5