먼저 읽는 요약
- 글의 관점 — 2026년 9월 29일 DevDay 발표를 컴퓨터 유즈 중심으로 읽었습니다. GPT-6.1 Sol을 직접 써본 후기는 아닙니다.
- 가격과 이용 경로 — 9월 30일 확인한 표준 API 입력·출력 단가는 Astra의 5분의 1입니다. ChatGPT Work·Codex 및 API 제공 안내이며, 일반 Chat은 당시 제공 대상이 아닙니다.
- 가장 기대하는 변화 — 컴퓨터 사용 평가에서 Astra와 점수 차이를 좁히면서 낮은 작업 비용을 제시했습니다. 실제로도 빠릿하게 일을 처리할지는 직접 써보며 확인할 부분입니다.

새 Sol의 위치와 이용 가격
2026년 9월 29일 DevDay에서는 20개 넘는 발표가 나왔지만, 제 관심은 한 가지였습니다. 이번에는 컴퓨터 유즈가 쓸 만해질까 하는 점입니다. 컴퓨터 유즈는 AI가 화면을 보고 마우스와 키보드를 조작하며 직접 일을 처리하는 기능입니다.
9월 30일 확인한 공식 안내에 따르면 새 Sol은 Plus·Pro·Business·Enterprise·Edu의 ChatGPT Work와 Codex에서 쓸 수 있었습니다. 일반 Chat은 아직 제공 대상이 아니었고 개발자는 API에서 gpt-6.1-sol로 호출할 수 있었습니다.

OpenAI가 종합 역량에서 가장 뛰어난 모델로 두는 것은 여전히 GPT-6 Astra입니다. Luna가 빠르고 효율적인 일상 작업을 맡는다면, 새 Sol은 그 사이에서 Astra에 가까운 일을 더 낮은 단가로 맡기겠다는 모델입니다. 기존 Sol의 할인판보다는 Sol의 가격에 성능을 끌어올린 업그레이드에 가깝습니다.
아래 표는 2026년 9월 30일 확인한 공식 표준 API 단가입니다. API는 모델을 프로그램에 연결해 사용하는 경로로, 월 구독료 대신 처리량에 따라 요금을 냅니다. 단위는 100만 토큰당 미국 달러이며, 공식 API 소개 페이지가 명시한 문맥 길이 272K, 즉 27만 2천 토큰 미만의 표준 처리 기준입니다.
| 모델 | 입력 | 캐시 입력 | 출력 |
|---|---|---|---|
| GPT-6 Astra | $10.00 | $1.00 | $50.00 |
| GPT-6.1 Sol | $2.00 | $0.10 | $10.00 |
| GPT-6 Luna | $0.10 | $0.01 | $0.50 |
토큰은 AI가 글 등을 처리하는 작은 단위로, 한글 한 글자나 단어 하나와 꼭 일치하지는 않습니다. 우리가 건네는 내용이 입력이고, AI가 만들어 내는 내용이 출력입니다.
새 Sol의 표준 입력·출력 단가는 Astra의 각각 5분의 1, 80% 낮은 가격입니다. 반복되는 입력 맥락을 재사용하는 캐시 입력은 별도 요금입니다. 새 Sol의 $0.10은 Astra의 캐시 입력 $1보다 90%, 새 Sol의 일반 입력 $2보다 95% 낮습니다. 캐시를 재사용할 때 적용되는 가격이라 매번 새로 읽히는 입력까지 이 금액으로 계산할 수는 없습니다.
API 단가가 낮아져도 Codex 구독 사용량이 다섯 배로 늘어난다는 보장은 없습니다. 실제로 선택할 수 있는 모델과 사용 한도·차감 조건은 계정의 모델 목록과 구독 안내에서 확인할 부분입니다.
Astra에서 좋았던 컴퓨터 유즈를 Sol 비용으로 기대합니다
저는 컴퓨터 유즈가 맥에 잘 되어 있다는 이야기를 듣고 그 기능을 쓰려고 맥을 사용하고 있습니다. 같은 작업을 시켰을 때 Astra는 5.6보다 컴퓨터 유즈가 더 빠릿빠릿했습니다. 반면 GPT-6 Sol은 직접 써보니 느리고 시원찮았습니다. 싸다는 장점을 느끼기 전에 답답함이 먼저 왔습니다.
새 Sol에 다시 큰 기대를 거는 건 Astra 쪽으로 성능이 올라오면서 비용은 Sol 수준이라는 조합 때문입니다. 모든 시험에서 Astra를 꺾기보다는 실제로 일을 맡길 만한 성능을 더 낮은 비용으로 쓸 수 있기를 바랍니다.

제가 가장 눈여겨본 건 OSWorld 2.0입니다. 일상적인 일부터 전문 업무까지 컴퓨터 애플리케이션에서 여러 조작을 이어가며 처리하는 시험이라, 제가 Codex에 기대하는 모습과 가장 가깝습니다.
그래프에서 밝은 노란 태양은 GPT-6.1 Sol, 짙은 주황 태양은 기존 GPT-6 Sol, 파란 별은 Astra입니다. 같은 모델에 점이 여러 개인 것은 문제를 풀 때 얼마나 깊게 생각할지, 즉 추론 강도를 달리했기 때문입니다. 가로축은 작업당 비용(달러), 세로축은 점수이므로 왼쪽 위에 있을수록 적은 비용으로 좋은 결과를 낸 셈입니다.
모두 최대 추론 강도인 Max로 맞추면 새 Sol은 기존 Sol보다 점수가 7%포인트 높으면서 작업당 비용은 절반도 들지 않았습니다. Astra와 비교해도 점수 차이는 2.1%포인트인데 비용은 약 7분의 1입니다. 토큰 단가는 Astra의 5분의 1이지만, 실제 작업에 쓰인 토큰 양까지 달라져 작업당 비용에는 더 큰 차이가 났습니다.
이 정도면 큰 기대를 걸 만합니다. 다만 제가 궁금한 건 비용뿐 아니라 실제로 일을 끝내는 속도이기도 합니다. 이번 그래프에는 소요 시간이 나오지 않으니, 새 Sol에서도 Astra처럼 빠릿하게 일을 처리할 수 있을지는 직접 써보며 확인할 부분입니다.
평가 방식도 함께 봐야 합니다. v2026.08.08 오프라인 시험 결과이며, 중간 수행에도 점수를 주는 부분점수 평가입니다. 그래서 70% 부근의 점수가 작업 100개 중 70개를 완벽하게 끝냈다는 뜻은 아닙니다. 세로축도 0이 아닌 40~75% 구간만 보여주므로, 점 사이가 벌어진 모양과 실제 점수 차이를 함께 봐야 합니다.
함께 발표된 Astra Ultrafast와 GPT-6.1 Sol Ultrafast는 별도의 고속 옵션입니다. API에서 제공되며 Work·Codex에서는 월 $500의 새 Pro 등급이 대상입니다. 발표에서 언급한 기존 Astra 대비 최대 8배 속도도 이 고속 옵션에 한정된 안내입니다.
개발·문서·업무 자동화는 각각 무엇을 평가했나
컴퓨터에 일을 맡기려면 화면을 조작하는 능력과 함께 그 안에서 해야 할 일을 이해하는 능력도 필요합니다. 그래서 코드를 고치고 문서를 읽고 업무를 끝내는 평가도 함께 봤습니다. 아래 세 그래프도 가로축은 작업당 비용, 세로축은 각 시험의 점수입니다.

DeepSWE v1.1은 기존 코드베이스, 즉 이미 만들어진 프로그램의 코드 묶음에서 긴 개발 과제를 해결하는 시험입니다. 짧은 코딩 문제에 정답 한 줄을 쓰기보다 주변 코드를 이해하고 기능을 고치거나 오류를 해결하는 일에 가깝습니다.
새 Sol은 High 설정에서 75.2%, 작업당 $0.65를 기록했습니다. 기존 Sol Max는 68.8%·$2.74, Astra의 매우 높음 설정은 74.1%·$4.43입니다. 이 비교에서 새 Sol은 더 낮은 추론 강도와 비용으로 기존 Sol의 최고 점수를 6.4%포인트 넘어섰습니다.
새 Sol의 Max 점수는 오히려 High보다 낮았습니다. 이 과제에서는 추론 강도를 가장 높이는 것보다 High로 두는 쪽이 더 좋은 결과를 낸 셈입니다. 제게는 모델의 서열보다 실제로 맡길 일을 감당할 선택지가 늘어나는 것이 중요합니다.

GDP.pdf는 금융·의료·법률 등 10개 전문 분야의 복잡한 PDF를 읽고 업무 질문에 답하는 시험입니다. 표와 그래프, 작은 글씨까지 살펴야 하므로 파일을 여는 데서 그치지 않고 내용을 제대로 이해하는 능력을 봅니다.
공식 설명상 새 Sol은 Astra에 가까운 점수를 내면서 작업당 비용은 약 5분의 1입니다. 막히면 다른 모델로 넘겨 마무리하는 ‘폴백’을 사용하는 Opus 5.5보다도 높은 점수를 내면서 비용은 절반 미만이었습니다.
세로축은 20~34% 구간만 보여줘 작은 점수 차이도 크게 벌어져 보입니다. 이 점수는 해당 전문 문서 시험의 결과이며, 모든 PDF를 정확하게 읽을 확률은 아닙니다. 시험 내용과 채점 기준이 다른 OSWorld·DeepSWE의 점수와 직접 순위를 매기기도 어렵습니다.

AutomationBench 1.0.6은 영업·마케팅·운영·고객지원·재무·인사에 걸친 47개 도구로 여러 단계 업무를 끝내는 시험입니다. OSWorld가 화면 속 앱 조작에 초점을 둔다면, 이쪽은 여러 업무 도구를 엮어 처음부터 끝까지 완수하는 능력을 봅니다. 제가 기대하는 자동화도 한 단계에서 멈추지 않고 끝까지 처리하는 쪽입니다.
새 Sol의 중간 추론 강도는 같은 설정의 기존 Sol보다 4.8%포인트, 발표에서 비교한 Opus 5.5 설정보다 2.2%포인트 높았고 Opus 대비 비용은 약 3분의 1이었습니다. 더 많은 비용으로 새 Sol보다 높은 점수를 낸 Opus 설정도 있으니, 위 수치는 발표에서 고른 설정끼리의 비교입니다.
Fable 5.1은 과제 약 40%에서 다른 모델로 넘기는 폴백을 썼지만, 각주에 따르면 그 추가 비용은 그래프에서 빠져 있습니다. 제가 실제로 얼마를 쓰게 될지 비교하려면 다른 모델의 도움을 받은 비용까지 더한 총비용을 봐야 합니다.
과학 연구에서는 Astra의 최고점이 남아 있습니다

Terminal-Bench Science 0.1은 명령을 입력하는 터미널과 코드로 데이터를 분석하고 시뮬레이션을 돌리는 시험입니다. 데이터에 맞는 모델을 조정하거나 수학 정리를 증명하는 등, 과학 상식을 답하는 데서 나아가 연구 작업을 실제로 진행하는 능력을 봅니다.
새 Sol은 Max에서 기존 Sol 점수의 두 배 이상을 기록했습니다. 평균 작업당 비용은 새 Sol $5.47, 비교 대상 Astra $23.80, 폴백을 쓰는 Opus 5.5 $23.21입니다. 그래도 시험의 최고 점수는 여전히 Astra의 68.1%입니다.
기존 Sol과의 차이가 크게 벌어진 점은 반갑습니다. 다만 두 배 이상이라는 개선은 이 과학 과제의 점수 차이로, 다른 작업의 성능이나 컴퓨터 조작 속도에 그대로 적용되는 배수는 아닙니다.
틀린 답과 끝내지 못한 일을 얼마나 솔직히 알리나
빠르고 싸게 끝내도 틀린 내용을 그럴듯하게 건네면 끝났다고 생각한 시점부터 확인할 일이 다시 시작됩니다. 능력만큼 결과를 얼마나 믿을 수 있는지도 중요합니다.

고난도 사실 오류율 평가는 사용자가 이전 모델의 오류를 신고한 대화를 개인을 알아볼 수 없도록 처리해 사용합니다. 단어별 오류가 아니라 사실 오류가 하나 이상 들어 있는 답변의 비율을 세며, 어려운 사례를 모았기 때문에 평소 모든 질문의 일반 오류율과는 다릅니다.
매우 높음 추론 강도에서 기존 Sol은 4.5%, 새 Sol은 4.1%, Astra는 4.0%였습니다. 기존 Sol 대비 개선은 0.4%포인트이고, 새 Sol의 작업당 비용은 Astra보다 약 83% 낮았습니다. 오류율은 앞선 성능 점수와 반대로 낮을수록 좋으므로, 비용까지 낮은 왼쪽 아래가 유리합니다.
비슷한 수준의 답을 더 적은 비용으로 기대할 수 있다는 점은 반갑습니다. 다만 Astra도 오류가 없는 모델은 아니어서 결과를 확인하는 일은 여전히 필요합니다.

검색 불능 미고지 평가는 검색 실력보다 검색할 수 없을 때 추측으로 답하지 않고 그 사실을 알리는지를 봅니다. 그래프는 문제를 알리지 않은 비율(%)을 모델별 막대로 나타냈으며, 낮을수록 좋습니다. 새 Sol은 기존 Sol보다 이 한계를 더 잘 알리는 방향으로 개선됐습니다. 최대 추론 강도로 일부러 까다롭게 만든 시험이라 평소 검색 전체의 실패율을 나타내는 값은 아닙니다.
컴퓨터를 맡기는 제게는 이런 항목이 실용적입니다. 일을 끝내지 못했다면 어디서 막혔는지 알려줘야 다음 판단을 할 수 있습니다. 검색을 못 했으면 못 했다고 말해주면 됩니다.
총평: 컴퓨터 유즈를 맡길 만한 선택지가 되기를 기대합니다
이번 성적표는 OpenAI가 정해진 도구와 설정에서 공개한 평가 결과로, 제가 직접 써본 경험과는 구분해서 보고 있습니다. 실제 Work·Codex의 결과와 체감은 도구·지침·작업 조건에 따라 달라질 수 있습니다.
그럼에도 새 Sol은 충분히 기대됩니다. 기존 Sol보다 여러 작업 점수가 올랐고, 특히 컴퓨터 사용 평가에서 Astra와의 격차를 좁히면서 작업 비용은 크게 낮췄습니다. 표준 입력·출력 단가도 Astra의 5분의 1이라 성능과 비용을 함께 봤을 때 이전보다 마음이 갑니다.
이제는 실제로 일을 맡겼을 때도 만족스러울지 확인해보고 싶습니다. 컴퓨터 유즈 때문에 맥을 쓰고 있는 만큼 지금 쓰고 있는 이유가 제대로 작동해줬으면 합니다.
컴퓨터 유즈, 그것만 제대로 해결해주면 좋겠습니다. 그러면 그래도 코덱스 쓰는 맛이 좀 날 것 같습니다.