먼저 읽는 요약
먼저 볼 설정 — 모델·추론·속도·병렬 작업을 각각 확인합니다. 모든 설정을 낮추기보다 같은 일을 제대로 끝내는 데 드는 비용을 비교하는 것이 기준입니다.
속도와 차감 — Astra Ultrafast의 최대 8배는 토큰 생성 속도입니다. 포함 사용량은 Standard의 8배, 구매 크레딧은 6배로 소비됩니다.
업그레이드 판단 — 한도 부족과 빠른 응답의 필요를 구분합니다. 최종 검증까지 걸린 시간, 재시도와 사람이 실제로 기다린 시간을 함께 봅니다.
Codex 사용량이 빨리 줄어들면 요금제부터 올리고 싶어집니다. 하지만 큰 모델과 높은 추론 강도, 빠른 속도와 여러 하위 에이전트를 한꺼번에 쓰고 있다면 먼저 설정을 살펴볼 필요가 있습니다. 필요한 사용량 자체가 부족한지, 작업에 비해 설정이 과한지 구분해야 하기 때문입니다. 제 판단 기준은 첫 답변이 나오는 속도보다 같은 성공 결과를 얻기까지 쓴 시간과 사용량, 그리고 재작업입니다.
Codex는 코드와 파일을 읽고 수정하며 명령 실행을 돕는 AI 에이전트 도구입니다. Codex 앱은 여러 프로젝트와 긴 작업을 다루는 데스크톱 환경이고, Codex CLI는 터미널에서 저장소를 살펴보고 수정·실행하는 도구입니다. 어느 쪽을 사용하든 모델·추론·속도·병렬 작업의 네 설정을 나눠 보면 불필요한 소비를 찾기 쉽습니다.

모델: 검증을 통과한 결과 하나의 비용을 봅니다
정해진 항목을 추출하는 반복 작업과 원인이 모호한 버그를 추적하는 일에 늘 같은 모델을 쓸 필요는 없습니다. 그렇다고 무조건 작은 모델로 바꾸는 것이 절약은 아닙니다. 누락과 오류 때문에 다시 요청하거나 사람이 오래 수정한다면 전체 비용은 오히려 늘 수 있습니다. 제가 비교하고 싶은 것은 모델의 서열이 아니라 검증을 통과한 결과 하나를 만드는 비용입니다.
모델 선택 안내를 작업에 대입하면 다음과 같이 출발점을 잡을 수 있습니다. 이용 가능한 모델과 추론 단계는 계정·클라이언트·워크스페이스에 따라 다르므로, 앱의 모델 선택기나 CLI의 /model에 실제로 표시되는 선택지를 확인합니다.
| 맡길 일 | 먼저 비교할 모델 | 추론 출발점 |
|---|---|---|
| 추출·분류처럼 범위와 정답 기준이 분명한 반복 작업 | GPT-6 Luna | High |
| 여러 단계를 거치는 일반적인 복합 업무와 코딩 | GPT-6.1 Sol | 사용 중인 클라이언트의 기본값 |
| 원인이 모호한 문제, 어려운 판단과 검증 | GPT-6 Astra | Light, CLI에서는 Low |
모델을 고를 때는 관련 파일, 반드시 고칠 부분, 이번에 다루지 않을 범위도 함께 정리합니다. 최종 답변이 짧아도 지시문·대화 기록·파일·도구 결과를 읽는 데 사용량이 들어갑니다. 다만 필요한 맥락이나 테스트까지 빼면 결과를 검증하기 어려워집니다. 줄일 것은 불필요한 범위이지, 결과를 믿을 근거가 아닙니다.
추론: 단계 이름보다 실제 결과를 확인합니다
추론 강도를 높이면 더 많은 시간과 토큰을 쓸 수 있지만, 복잡한 계획과 검증에는 도움이 될 수 있습니다. 여기서 Luna의 High와 Astra의 Light를 같은 척도로 비교해서는 안 됩니다. 추론 단계는 서로 다른 모델을 관통하는 공통 성능 등급표가 아닙니다. 우선 기본 설정의 결과를 보고, 놓친 조건이나 부족한 검토가 있을 때 필요한 만큼 올리는 편이 차이를 판단하기 쉽습니다.
이름이 비슷한 Ultra와 Ultrafast도 구분해야 합니다. Ultra는 추론과 하위 에이전트 활용에 관한 선택이고, Ultrafast는 속도 서비스입니다. Ultra는 나눌 수 있는 복잡한 일을 하위 에이전트에 맡기는 방식까지 활용합니다. Ultrafast를 켠다고 Ultra를 선택한 것은 아니며, Ultra가 항상 가장 빠른 응답을 뜻하는 것도 아닙니다.
속도: 생성 속도와 사용량 차감을 구분합니다

Astra Ultrafast의 ‘최대 8배’는 토큰 생성 속도에 관한 수치입니다. 포함 사용량의 소비 배율도 8배지만 속도와 차감은 별개이며, 추가 구매한 크레딧의 소비 배율은 6배입니다. 속도 설정을 읽을 때는 생성 속도와 사용량·크레딧의 차감을 각각 확인해야 합니다. Fast도 포함 사용량과 구매 크레딧의 배율이 다릅니다.
| 속도 설정 | 포함 사용량 | 구매 크레딧 |
|---|---|---|
| Standard | 1배 | 1배 |
| Fast(지원 모델) | 2.5배 | 2배 |
| Ultrafast — GPT-6 Astra | 8배 | 6배 |
표는 같은 모델의 Standard 대비 소비 배율입니다. 처리 속도를 나타내거나 서로 다른 모델의 사용량을 동일한 1배로 비교한 표가 아닙니다. CLI에서는 지원 모델에 한해 /fast로 Fast를 켜고 끌 수 있습니다. 항상 켜두기보다 다음 출력을 기다리느라 사람이 실제로 멈춰 있는 작업에서 먼저 비교해볼 만합니다.
전체 작업에 100초가 걸리고 토큰 생성이 20초, 빌드나 외부 응답 대기가 80초라고 가정해보겠습니다. 토큰 생성 부분이 정확히 8배 빨라져도 전체 시간은 80 + 20 ÷ 8 = 82.5초로, 약 1.21배 빨라집니다. 실제 Codex 측정값이 아니라 속도 숫자를 읽기 위한 산술 예시입니다. 빌드나 브라우저 로딩이 대부분이라면 생성 속도의 이점은 제한적이고, 생성 지연이 주된 대기 원인이라면 추가 소비를 감수할 이유가 생길 수 있습니다.

Codex와 ChatGPT Work에서 Ultrafast를 이용할 수 있는 대상은 Pro 월 $500과 적격 Enterprise·Edu입니다. Pro $500에서는 포함 사용량을 먼저 쓰고, 소진한 뒤 이용 가능한 크레딧을 사용합니다. 다른 개인 플랜에서 크레딧만 추가 구매한다고 Ultrafast 자격이 생기는 것은 아닙니다. 이용 자격과 사용량 추가 구매를 구분해야 하며, 크레딧 소비 6배와 생성 속도 최대 8배를 곱해 사용 가능한 시간을 계산해서도 안 됩니다.
병렬 작업: 나눌 수 있는 일만 나눕니다
독립된 자료 조사나 서로 다른 관점의 코드 검토는 나눠서 진행할 수 있습니다. 반면 앞 단계의 결과가 필요한 작업을 억지로 나누면 같은 자료를 다시 읽고 결과를 합치는 일이 늘어날 수 있습니다. 하위 에이전트도 각각 모델과 도구를 사용하므로, 세 개를 실행했다고 정확히 세 배를 소비하는 것도 아니고 시간이 줄었다고 사용량까지 줄었다고 볼 수도 없습니다. 병렬화에는 추가 사용량이 들 수 있습니다.

하위 에이전트 설정에서는 부모의 설정과 실제 하위 작업의 설정을 함께 확인합니다. 별도 지정이 없으면 부모의 모델과 추론 강도를 상속합니다. 다만 명시적인 생성 요청이나 [agents] 기본값으로 모델을 선택하면서 추론을 지정하지 않으면 그 모델의 기본 추론이 적용될 수 있습니다. 커스텀 에이전트 파일에서 model만 덮어쓰는 경우에는 앞서 결정된 추론 강도가 유지됩니다. 모델을 바꿨다는 이유로 추론도 낮아졌다고 생각하지 말고 두 항목을 함께 봐야 합니다.
속도는 service_tier라는 별도 설정입니다. agents.max_concurrent_threads_per_session은 주 에이전트를 제외한 동시 하위 스레드 수를 제한하는 항목이며, 총 토큰이나 지출액의 상한이 아닙니다. 설정 파일을 수정한다면 구성 항목 안내에 따라 실제 적용값을 확인하고, 요청문에는 어떤 일을 나눌지와 성공 조건을 분명히 적는 것이 좋습니다.
요청문은 다음처럼 작성할 수 있습니다.
먼저 관련 파일을 읽고 수정 범위를 정해줘. 독립적으로 진행할 수 있는 조사만 병렬로 나누고, 각 하위 작업의 모델과 추론 강도를 알려줘. 성공 조건은 지정한 테스트 통과와 변경 사항 설명이야. 필요한 검증은 유지하되, 관련 없는 리팩터링은 이번 범위에서 제외해줘.
사용량 비교: 같은 성공 조건으로 기록합니다

사용량 대시보드에서 현재 한도와 초기화 시점을 확인합니다. 활성 Codex CLI 세션에서는 /status로 남은 한도를 볼 수 있으며, 화면에 표시된 값이 사용한 비율인지 남은 비율인지도 구분해야 합니다. ChatGPT Work와 Codex는 사용량을 공유하므로 비교 중 양쪽에서 다른 작업을 계속 실행하면 이번 작업의 소비량을 따로 파악하기 어렵습니다.
사용량이 부족할 때도 먼저 어느 한도에 걸렸고 언제 다시 열리는지 확인합니다. 현재 Pro의 Work·Codex에는 5시간 사용량 제한이 없지만, 주간 한도가 없거나 무제한이라는 뜻은 아닙니다. 한도를 소진했다면 초기화 시점을 기다리는 방법과 계정에서 가능한 추가 크레딧 이용을 구분합니다. 별도 초기화 옵션이 표시된다면 초기화 대상과 만료·결제 조건을 확인해야 하며, 모든 계정에 무료 수동 초기화가 제공된다고 전제해서는 안 됩니다.
비교 목표는 ‘30분 실행’보다 ‘같은 버그를 수정하고 지정한 테스트 통과’처럼 결과로 정합니다. 시작 코드와 자료를 맞추고, 우선 모델·추론·하위 에이전트 구성을 고정한 채 Standard와 Fast만 바꿉니다. 모델을 비교할 때는 속도를 고정합니다. 네 설정을 동시에 바꾸면 어떤 변경이 효과를 냈는지 알기 어렵습니다. 아래는 직접 비교할 때 채우는 빈 기록표입니다.
| 기록할 항목 | 비교 A | 비교 B |
|---|---|---|
| 시작 코드·자료 / 성공 조건 | ||
| 모델 / 추론 / 속도 | ||
| 하위 에이전트 수와 각각의 설정 | ||
| 시작 시각 / 종료 시각 | ||
| 시작 잔여량 / 종료 잔여량 | ||
| 초기화 시점 / 도중 초기화 여부 | ||
| 최종 성공 여부 / 실패·재시도 횟수 | ||
| 검증 완료까지 걸린 시간 | ||
| 사람이 고친 시간 / 실제로 막혀 있던 대기 시간 |
첫 답변이 빨라도 테스트를 통과하지 못했다면 작업은 끝나지 않은 것입니다. 다시 시킨 횟수, 사람이 손본 시간, 최종 검증까지 함께 기록해야 비교가 됩니다. 큰 모델이 처음에는 더 많이 소비하더라도 한 번에 제대로 끝내 전체 사용량과 수고를 줄인다면 더 나은 선택일 수 있습니다.
단위도 그대로 기록해야 합니다. 잔여율이 80%에서 74%로 줄었다면 6퍼센트포인트 감소이며, 상대적으로 6% 줄었다는 뜻은 아닙니다. 대시보드의 반올림·갱신 지연 때문에 짧은 시험의 미세한 차이는 정확히 읽기 어렵고, 도중에 초기화됐다면 단순 차감 비교는 유효하지 않습니다. 문맥·캐시·도구 결과도 매번 같지 않으므로 대표 작업 여러 개에서 경향을 보고, 한 번의 결과로 월 사용 가능 시간을 확정하지 않습니다.
요금제: 한도 부족과 빠른 응답의 필요를 나눕니다

요금제의 USD 표시 가격은 Plus 월 $20, Pro 월 $100·$200·$500입니다. 업그레이드를 검토할 때는 사용량이 모자란 것인지, 더 빠른 Astra 응답이 필요한 것인지부터 구분합니다. 가끔 한도를 넘는다면 추가 크레딧과 업그레이드 비용을 비교할 수 있고, Ultrafast가 필요하다면 이용 자격도 함께 봐야 합니다.
| 사용 방식 | 적용되는 예산·요금 |
|---|---|
| ChatGPT로 로그인해 쓰는 Codex | 플랜에 포함된 사용량 |
| 포함 사용량을 소진한 뒤 추가 이용 | 이용 자격과 조건에 따른 구매 크레딧 |
| API 키로 쓰는 Codex | 구독 포함분과 별도인 API 요금 |
구독 포함 사용량, 구매 크레딧, API 요금은 별도로 계산합니다. API 토큰 단가로 구독료를 나눠 플랜에 포함된 토큰 수를 역산할 수 없으며, 크레딧 요율만으로 포함 사용량의 차감 속도를 전부 설명할 수도 없습니다. API 키로 사용하는 Codex는 API 요금이 별도로 적용되고, 이용 조건 역시 구독의 Ultrafast 자격과 구분해 확인해야 합니다.
Pro $200에서 $500로 올리면 표시 가격 차이는 월 $300입니다. 같은 한 달 동안 실제로 줄어드는 대기 시간과 이 비용을 비교하면 판단에 도움이 됩니다. 다만 다른 일을 하며 기다린 시간을 전부 절약한 시간으로 계산해서는 안 됩니다. 사람이 정말 막혀 있던 시간, 실패로 다시 작업한 시간, 검토에 줄어든 수고를 구분해야 합니다. 아직 이용할 수 없는 Ultrafast의 효과를 최대 8배라는 수치로 대신 가정할 수도 없습니다.
총평: 같은 일을 제대로 끝내는 비용으로 판단합니다
제 기준은 작업에 맞는 모델과 필요한 만큼의 추론을 고르고, 대기를 줄이는 값어치가 있을 때 속도를 올리며, 독립적으로 진행할 수 있는 일만 나누는 것입니다. 그래도 필요한 일을 제때 끝내지 못하거나 더 비싼 선택이 재작업과 대기를 충분히 줄여준다면 업그레이드할 이유가 있습니다. 결제 전에 비교할 것은 가장 비싼 설정이 아니라 내 일을 가장 경제적으로 끝내는 설정입니다.
