같은 저장소 요청도 여러 번 시도해야 할 수 있습니다. 에이전트가 패치를 제안하고 테스트를 실행한 뒤 오류를 수정하기 때문입니다. 토큰 가격이 낮다는 사실만으로는 수락 가능한 변경을 얻는 데 드는 비용이라는 핵심 질문에 답할 수 없습니다.
2026년 10월 2일 기준으로 답은 다음과 같습니다. GPT‑6.1 Sol의 표준 API 입력 및 출력 토큰 요금은 GPT‑6 Astra보다 5배 낮습니다. OpenAI는 또한 한 에이전트 코딩 벤치마크에서 Sol이 Astra와 동등한 성능을 보였다고 밝혔습니다. 그러나 이것이 Codex 전반에서의 동급 성능을 입증하거나, 승인 가능한 패치의 비용을 5배 절감한다고 보장하지는 않습니다.
먼저 API와 Codex 구독을 구분하세요
API는 사용한 토큰 수에 따라 요금이 부과됩니다. ChatGPT를 통한 Codex에는 유료 플랜의 포함 사용량 한도가 있으므로 API 가격을 그대로 적용할 수 없습니다. OpenAI는 한도 소모량이 모델, 작업, 설정에 따라 달라지고 API 사용료는 별도라고 설명합니다. 자세한 내용은 Work 및 Codex 사용량 안내를 참고하세요.
표에는 입력 컨텍스트가 272,000토큰 이하인 요청의 100만 토큰당 표준 API 요금이 나와 있습니다.
| 모델 | 일반 입력 | 캐시 입력 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|
| GPT‑6.1 Sol | $2 | $0,10 | $2,50 | $10 |
| GPT‑6 Sol | $2 | $0,20 | $2,50 | $10 |
| GPT‑6 Astra | $10 | $1 | $12,50 | $50 |
| GPT‑6 Luna | $0,10 | $0,01 | $0,125 | $0,50 |
일반 입력 및 출력 요금 기준으로 Sol은 Astra보다 5배 저렴하고, 캐시 입력은 10배 저렴합니다. 하지만 GPT‑6 Sol과 비교하면 새 버전의 일반 입력 및 출력 요금은 더 낮지 않습니다. 요금상 이점은 캐시 입력으로, 가격이 절반으로 줄었습니다. Luna는 세 모델보다 훨씬 저렴하지만, 가격이 낮다는 사실만으로 복잡한 작업을 얼마나 잘 수행할지 알 수는 없습니다. 이 요금은 OpenAI API 가격표에 나와 있습니다.
같은 시도 한 번의 비용은 얼마일까
비교를 위해 다음과 같은 가상의 요청을 가정해 보겠습니다. 새 입력 토큰 20,000개, 캐시 입력 토큰 80,000개, 출력 토큰 10,000개. 캐시가 적중했다고 가정하며, 캐시 쓰기, 도구 호출, 재시도는 계산에서 제외합니다.
| 모델 | 계산 | 비용 |
|---|---|---|
| GPT‑6.1 Sol | $0,040 + $0,008 + $0,100 | $0,148 |
| GPT‑6 Sol | $0,040 + $0,016 + $0,100 | $0,156 |
| GPT‑6 Astra | $0,200 + $0,080 + $0,500 | $0,780 |
| GPT‑6 Luna | $0,002 + $0,0008 + $0,005 | $0,0078 |
이런 구성의 요청이라면 Sol을 한 번 시도하는 비용은 Astra보다 약 5.3배 낮습니다. GPT‑6 Sol과 비교하면 차이는 $0,008, 즉 시도 비용의 약 5.1%입니다. 이는 산술 예시이지 일반적인 Codex 작업의 측정값은 아닙니다. 모델마다 토큰 사용량, 도구 호출 횟수, 재시도 횟수가 다를 수 있습니다.
요금이 달라지는 기준도 있습니다. 입력 컨텍스트가 272,000토큰을 넘는 요청은 입력 및 캐시 요금이 2배, 출력 요금이 1.5배로 올라가며, 이 요금은 요청 전체에 적용됩니다. 따라서 긴 컨텍스트에는 별도의 조정 없이 위 계산을 적용할 수 없습니다. 조건은 GPT‑6.1 Sol 모델 페이지에 안내되어 있습니다.
Astra와의 비교가 실제로 입증하는 것
GPT‑6.1 Sol 발표에서 OpenAI는 실제 코드베이스의 복잡한 엔지니어링 작업을 평가하는 벤치마크인 DeepSWE v1.1에서 Sol이 Astra와 동등한 성능을 냈으며 비용은 약 5분의 1이었다고 밝혔습니다. 여기서 정확한 표현은 “OpenAI 데이터 기준 DeepSWE v1.1에서”입니다.
컴퓨터 작업 수행 능력을 평가하는 OSWorld 2.0에서는 최고 추론 수준에서 Sol이 Astra에 2.1퍼센트포인트 뒤처졌습니다. OpenAI 추산으로는 과제당 비용이 약 7배 낮았습니다. 회사는 연구 환경 또는 API를 통해 평가를 진행했으며, 시스템 지침, 도구, 설정이 달라 실제 운영 인터페이스에서의 결과와 다를 수 있다고 경고합니다.
이는 공급업체가 직접 발표한 결과이지, 동일한 Codex 작업 흐름에서 모델을 독립적으로 검증한 결과가 아닙니다. 이 기사에서 검토한 자료에는 동일한 Codex 작업으로 Sol과 Astra를 비교한 독립 테스트가 없습니다.
개발자들은 어떻게 말할까
출시 직후의 논의는 자신의 환경에서 모델을 시험해 볼 이유는 되지만, 대표성 있는 테스트는 아닙니다. 한 속도와 사용량 한도를 다룬 Reddit 글에서 사용자들은 생성 속도가 느리다고 불평합니다. 한 작성자는 간단한 작업이나 컨텍스트 압축에도 자신은 최소 2분이 걸렸다고 말합니다. 이는 동일한 작업이나 통제된 조건에서 얻은 결과가 아닌 단일 관찰입니다.
다른 Sol 속도에 관한 토론에서는 의견이 엇갈립니다. 일부는 느린 생성을 문제로 여기고, 다른 이들은 토큰 출력 속도만으로 전체 작업에 걸리는 시간을 알 수 없다고 지적합니다. 이는 서로 다른 지표이며, 해당 토론은 어느 쪽도 통제된 방식으로 측정하지 않았습니다.
게임 데모를 만드는 과정에 대한 단일 부정적인 사용 후기도 있습니다. 작성자는 모델이 요구사항을 놓쳤고, 구체적으로 요청한 뒤에도 중요한 결함을 수정하지 못했다고 전합니다. 이는 모델 전반의 품질을 측정한 것도, Astra와 직접 비교한 것도 아닙니다.
마지막으로 VS Code 확장 프로그램의 모델 선택에 관한 GitHub 이슈에서 한 사용자는 9월 30일에 데스크톱 Codex에는 Sol이 표시되지만 Windows 확장 프로그램 모델 목록에는 없었다고 보고했습니다. 이는 특정 설정에 대한 설명일 뿐, 문제의 원인이나 범위를 입증하지 않습니다.
이 게시물들의 작성자는 확인 가능한 실명이 아닌 가명을 사용하므로, 실제 이름이 확인된 직접 인용은 싣지 않았습니다. 초기 평가에서 얻을 수 있는 실용적인 결론은 보다 제한적입니다. 품질, 작업 완료 속도, 사용량 한도를 각각 따로 측정해야 합니다.
간단한 연표
- 2026년 9월 3일. OpenAI가 GPT‑6 Astra를 공개했습니다.
- 2026년 9월 22일. GPT‑6 Sol과 GPT‑6 Luna가 API에 출시되었습니다.
- 2026년 9월 29일. OpenAI가 API, ChatGPT Work, Codex용 GPT‑6.1 Sol 출시를 발표했습니다.
- 2026년 9월 30일. Windows의 VS Code 확장 프로그램 모델 목록에 Sol이 없다는 내용이 GitHub에 올라왔습니다.
출시 날짜는 OpenAI API 변경 기록에 나와 있으며, VS Code 관련 보고는 해당 GitHub 토론에서 확인할 수 있습니다. 이는 초기 연혁일 뿐, 모든 사용자의 모델 이용 가능 여부에 대한 평가는 아닙니다.
Sol과 Astra, 어떤 경우에 선택할까
OpenAI는 Plus 및 Standard Business 사용자에게 5시간 동안 Sol은 로컬 메시지 약 15~160개, Astra는 5~45개를 처리할 수 있다고 안내합니다. 이는 보장된 작업 수가 아닙니다. 사용량은 모델, 작업, 설정에 따라 달라지고, 클라우드 작업은 한도를 더 많이 소모할 수 있으며 주간 한도가 적용될 수도 있습니다. 이 수치를 절감률로 바꾸거나 API 가격과 직접 비교해서는 안 됩니다. 자세한 조건은 Work 및 Codex 한도 안내를 참고하세요.
실용적인 선택은 오류 비용과 대기 시간에 달려 있습니다.
- Sol은 시험해 볼 만합니다. 테스트와 명확한 승인 기준이 있는 것처럼 결과를 쉽게 검증할 수 있는 반복 작업에 적합한 후보입니다. 표준 API 요금은 Astra보다 크게 낮습니다.
- 복잡하거나 위험도가 높은 작업에는 Astra를 유지할 수 있습니다. 한 번의 시도 비용보다 결과 품질이 중요할 때 고려할 수 있습니다. 특정 팀의 작업을 더 잘 처리하는지는 직접 검증해야 합니다.
- Luna는 단순하고 반복적인 작업에 적합할 수 있습니다. 품질이 충분한 경우에 한합니다. 토큰 가격이 가장 낮다고 해서 복잡한 작업도 이 모델로 더 저렴하게 끝난다는 뜻은 아닙니다.
비교하려면 모델마다 동일한 소규모 작업 세트를 실행하고, 테스트 통과, 요구사항 충족, 코드 리뷰 승인 등 허용 가능한 결과의 기준을 미리 정하세요. 시도 횟수, 토큰 사용량, 도구 호출, 패치를 완성하는 데 걸린 시간을 기록하세요. 그러면 답변 가격이 아니라 결과를 얻는 비용을 평가할 수 있습니다.
결론: Sol의 일반 API 입력 및 출력 토큰은 Astra보다 실제로 5배 저렴하며, OpenAI는 한 에이전트 코딩 테스트에서 동등한 결과를 냈다고 보고합니다. 하지만 Codex 전반에서 동급이라는 증거는 충분하지 않습니다. 구독 환경에서는 API 절감액을 그대로 적용할 수 없고, 개발자들의 초기 평가도 산발적이며 엇갈립니다. Sol은 비용을 낮출 수 있는 타당한 후보지만 Astra를 대체할지는 두 모델이 해당 팀의 작업을 어떻게 수행하는지에 달려 있습니다.