
OpenAI가 2026년 9월 22일 GPT-6 Sol과 GPT-6 Luna를 공개했습니다. 이달 초 출시된 GPT-6 Astra가 가장 어려운 문제를 해결하는 최상위 모델이라면 이번에 추가된 두 모델은 GPT-6의 성능을 더 낮은 비용으로 사용할 수 있도록 구성됐습니다.
Astra, Sol, Luna는 무엇이 다를까요?
Astra는 결과의 품질을 가장 우선해야 할 때 선택하는 모델입니다. 복잡한 연구나 중요한 의사결정처럼 비용보다 정확도와 깊이가 중요한 작업에 맞습니다.
Sol은 높은 성능을 유지하면서 사용량을 늘리기 쉬운 위치에 놓였습니다. 실제 코드베이스를 수정하거나 여러 도구를 연결하는 업무, 긴 문맥을 유지해야 하는 에이전트에 적합합니다.
Luna는 대량 처리와 일상적인 자동화에 초점을 둡니다. 단가가 낮아 분류, 추출, 반복 분석처럼 요청 횟수가 많은 기능에 적용하기 좋습니다.
API 가격은 절반 수준으로 내려갔습니다
GPT-6 Sol의 가격은 100만 토큰 기준 입력 2달러, 출력 10달러입니다. GPT-5.6 Sol의 프로모션 가격이었던 4달러와 20달러에서 절반으로 낮아졌습니다.
Luna는 입력 0.10달러, 출력 0.50달러입니다. 이전 세대는 각각 0.20달러와 1.20달러였습니다. OpenAI는 두 모델 모두 GPT-5.6의 프로모션 가격보다 50% 저렴해졌다고 설명했습니다.
모델 호출이 한두 번으로 끝나는 기능에서는 작은 차이처럼 보일 수 있습니다. 하지만 긴 코딩 세션이나 여러 도구를 순서대로 실행하는 에이전트는 같은 문맥을 계속 전달하기 때문에 단가 차이가 전체 운영비에 직접 반영됩니다.
전문 업무에서는 Sol의 비용 대비 성능이 두드러졌습니다
여러 애플리케이션을 연결해 실제 업무 절차를 수행하는 AutomationBench에서 GPT-6 Sol은 xhigh 설정으로 33.2%를 기록했습니다. 낮은 사고 수준의 Astra는 30.3%, Claude Opus 5는 26.9%, Opus 5 폴백을 포함한 Claude Fable 5.1은 31.4%였습니다.
Sol의 작업당 비용은 0.27달러였습니다. 같은 평가에서 Astra는 3.9배, Opus 5는 11.1배, Fable 5.1은 8.9배 이상 들었습니다. Fable 수치에는 약 40%의 작업에서 발생한 Opus 5 폴백 비용이 포함되지 않아 실제 격차는 더 클 수 있습니다.
장시간 전문 업무를 평가하는 Agents’ Last Exam에서는 최대 사고 수준으로 56.4%를 기록했습니다. Claude Opus 5의 최고 점수를 넘어섰고 작업당 비용은 60% 낮았습니다.
코딩에서는 Fable과 비슷한 결과를 더 낮은 비용으로 냈습니다

FrontierCode는 코드가 실행되는지만 확인하지 않습니다. 테스트 품질과 수정 범위, 코드 스타일, 기존 프로젝트 규칙을 함께 살펴 실제로 병합할 수 있는 변경인지 평가합니다.
이 항목에서 Sol은 Claude Fable 5.1의 xhigh 결과와 비슷한 수준에 도달했습니다.
복잡한 소프트웨어 개발 문제를 다루는 DeepSWE에서는 최대 사고 수준으로 68.8%를 기록했고, Claude Fable 5의 최고 점수인 69.9%와 1.1%포인트 차이였으며 작업 비용은 약 80% 낮았습니다.
Luna도 같은 평가에서 66.6%를 기록했습니다. 중간 사고 수준의 Claude Opus 5와 Fable 5에 견줄 만한 결과로 비교 대상보다 각각 93%, 96% 적은 비용이 들었습니다. 가장 저렴한 계열이라고 해서 간단한 코드 생성에만 한정된 모델은 아니라는 점을 보여주는 부분이죠.
사실성은 높이고 답변은 짧아졌습니다
사용자가 실제 대화에서 오류를 신고했던 어려운 질문으로 평가했을 때 Sol의 사실 오류는 GPT-5.6 Sol의 절반 수준으로 줄었습니다.
Luna 역시 높은 사고 수준에서는 이전 Sol과 비슷한 정확도를 보이면서 비용은 약 100분의 1에 그쳤습니다.
Astra에 적용된 답변 방식도 두 모델에 이어졌습니다. 기술적인 대화에서 불필요한 전문 용어와 모호한 표현을 줄이고 확인한 내용과 수행하지 않은 범위를 구분해 설명합니다. 전체 길이는 조금 짧아졌지만 결과를 검토하는 데 필요한 정보는 남기는 방향입니다.
컴퓨터 조작에서도 비용 차이가 컸습니다
여러 화면과 애플리케이션을 오가며 작업하는 OSWorld 2.0에서 Sol은 xhigh 설정으로 60.5%를 기록했습니다.
중간 사고 수준의 Claude Opus 5는 60.3%였으며, Sol의 작업 비용은 약 80% 낮았습니다.
Luna는 최대 사고 수준에서 GPT-5.6 Sol의 중간 설정보다 높은 결과를 냈고 비용은 10분의 1이었습니다.
브라우저나 데스크톱 앱을 직접 조작하는 자동화에서도 더 작은 모델을 선택할 수 있는 범위가 넓어진 셈입니다.
장시간 에이전트에서는 캐시 개선도 중요합니다
GPT-6의 프롬프트 캐시는 이전 문맥을 더 높은 비율로 재사용하도록 개선됐습니다. 캐시된 입력 토큰에는 90% 할인된 가격이 적용되기 때문에 시스템 프롬프트나 도구 정의, 저장소 설명을 반복해서 보내는 서비스에서 효과가 큽니다.
사고 수준을 바꾸거나 사용할 도구를 활성화·비활성화해도 앞부분의 캐시는 유지됩니다. 필요한 지점에 명시적인 구분점을 두어 재사용 범위를 조절할 수도 있습니다. Prompt Caching Dashboard와 진단 도구에서는 적중률과 놓친 구간의 원인을 확인할 수 있습니다.
GitHub는 이런 개선을 적용한 뒤 Copilot에서 새로 처리해야 하는 프롬프트 토큰의 비율이 50% 이상 줄었다고 밝혔습니다. 에이전트의 비용을 계산할 때 모델 단가와 함께 캐시 적중률을 살펴봐야 하는 이유입니다.
코딩 결과를 과장하는 문제도 줄였습니다
Sol과 Luna에는 Astra에서 시작한 정렬 방식이 적용됐습니다. OpenAI의 평가에서는 두 모델 모두 이전 GPT-5.6 계열보다 코딩 작업을 실제로 완료하지 않았으면서 끝냈다고 주장하는 비율이 낮아졌습니다.
다만 이 평가는 의도적으로 실패하기 어려운 상황을 구성한 것으로 일반적인 사용 환경의 오류율을 의미하지는 않습니다.
그럼 이걸 어디에서 사용할 수 있을까요?
GPT-6 Sol과 Luna는 ChatGPT Work와 Codex에서 Plus, Pro, Business, Enterprise, Edu 사용자에게 순차적으로 적용됩니다. Free와 Go 사용자는 데스크톱 앱에서 Luna를 사용할 수 있습니다. 발표 시점 기준 일반 Chat에는 아직 추가되지 않았습니다.
API 모델 ID는 각각 gpt-6-sol과 gpt-6-luna입니다. 계정에 바로 나타나지 않는 경우 서비스 안정성을 위해 단계적으로 배포 중일 수 있으므로 시간을 두고 다시 확인해야 합니다.
벤치마크 결과가 실제 프로젝트의 생산성을 그대로 보장하지는 않습니다. 기존에 사용하던 모델과 동일한 작업을 맡긴 뒤 테스트 통과율, 추가 수정 횟수, 완료 시간, 토큰 사용량과 캐시 적중률을 함께 비교하면 어느 모델이 서비스에 맞는지 판단하기 쉽습니다.
출처
'AI' 카테고리의 다른 글
| [바미] 클로드 오푸스 5.5 출시 되었습니다! 코딩 성능부터 비용까지 무엇이 달라졌을까요~? (0) | 2026.09.23 |
|---|---|
| [바미] AI는 미래의 버그를 미리 예측할 수 있을까? (0) | 2026.09.21 |
| [바미] AI가 일을 대신해 주면 사람은 무엇을 준비해야 할까? (0) | 2026.09.10 |
| [바미] AI 에이전트 하나로 충분할까? 작업 흐름과 GraphRAG 이해하기 (0) | 2026.09.09 |
| [바미] Claude와 Figma를 연결하면 화면 디자인부터 웹페이지까지 만들 수 있을까? (0) | 2026.09.08 |