AI 뉴스

오픈AI GPT-6 솔·루나 출시 — API 가격 50% 인하, 성능·요금·사용법 총정리

sombaragi 2026. 9. 24. 08:30
🤖 AI 뉴스

오픈AI가 9월 23일 GPT-6 솔과 GPT-6 루나를 출시했다. GPT-6 아스트라 방식으로 학습한 보급형 모델로, API 가격은 GPT-5.6 대비 50% 낮은 100만 토큰당 2달러·0.1달러다. 성능 벤치마크와 요금, 사용법을 정리했다.

GPT-6 솔과 루나 출시를 상징하는 태양과 초승달 모양의 빛나는 신경망 노드와 벤치마크 막대 일러스트

오픈AI는 현지 시간 9월 22일(한국 시간 23일) GPT-6 솔(Sol)과 GPT-6 루나(Luna)를 공개했다. 이달 초 나온 최상위 모델 GPT-6 아스트라의 학습 방식을 그대로 적용해 속도와 비용을 낮춘 두 모델로, API 요금은 이전 세대 GPT-5.6 솔·루나의 프로모션 가격보다 50% 싸다. 챗GPT 워크와 코덱스에는 출시 당일부터 순차 적용됐고, 일반 채팅에는 아직 들어오지 않았다.

GPT-6 솔·루나, 무엇이 나왔나

오픈AI의 GPT-6 제품군은 이제 세 단계다. 가장 어렵고 중요한 작업에 쓰는 GPT-6 아스트라, 그 아래에서 전문 업무와 복잡한 코딩을 맡는 GPT-6 솔, 대량의 단순 반복 작업을 싼값에 처리하는 GPT-6 루나다. 오픈AI는 GPT-6 솔과 루나가 아스트라와 비슷한 방법으로 훈련되어 전문 업무, 사실 정확성, 코딩, 컴퓨터 사용, 정렬(alignment) 다섯 영역에서 각각 GPT-5.6 솔·루나보다 나아졌다고 설명했다.

발표 배경에는 최근 오픈AI가 꺼낸 개발 속도 조절 논의가 있다. 샘 올트먼 대표가 드림포스 2026 무대에서 AI 개발 속도의 위험을 언급한 직후, 회사는 최상위 모델이 아니라 가성비 모델을 내놓았다. 오픈AI는 캐싱과 추론 인프라 개선으로 서비스 원가가 낮아졌고, 그 절감분을 가격 인하로 돌렸다고 밝혔다. 이 인하는 기간 한정 프로모션이 아니라 만료일이 없는 정식 요금이다.

GPT-6 솔 가격과 루나 가격 — API 요금표와 캐싱 할인

API 기준 GPT-6 솔 가격은 100만 토큰당 입력 2달러, 출력 10달러다. GPT-5.6 솔의 입력 4달러·출력 20달러에서 정확히 절반이 됐다. GPT-6 루나 가격은 입력 0.10달러, 출력 0.50달러로, GPT-5.6 루나의 0.20달러·1.20달러와 비교하면 입력은 절반, 출력은 절반 아래로 내려왔다. 모델 ID는 gpt-6-sol과 gpt-6-luna다.

GPT-6 API 요금 (100만 토큰당, 오픈AI 공식)

  • GPT-6 솔: 입력 2달러 · 출력 10달러 (GPT-5.6 솔 4달러 · 20달러에서 50% 인하)
  • GPT-6 루나: 입력 0.10달러 · 출력 0.50달러 (GPT-5.6 루나 0.20달러 · 1.20달러에서 50% 이상 인하)
  • 캐시된 입력 토큰 읽기: 90% 할인, 기본 캐시 적중률 상향
  • GPT-6 아스트라: 가격 변동 없음, 최고 성능이 필요할 때 선택

토큰 단가보다 실제 청구액에 더 크게 작용하는 것은 프롬프트 캐싱이다. GPT-6는 반복해서 보내는 시스템 프롬프트나 문서 같은 입력 문맥을 자동으로 더 많이 재사용하도록 기본 캐시 적중률을 높였고, 캐시에서 읽는 입력 토큰에는 90% 할인이 붙는다. 대화 중간에 추론 강도를 바꾸거나 도구를 켜고 꺼도 앞선 문맥의 캐시가 깨지지 않게 됐고, 개발자가 캐시 구간의 끝을 직접 지정하는 브레이크포인트도 생겼다. 깃허브는 최근 몇 달 동안 이런 개선으로 새로 처리해야 하는 프롬프트 토큰 비중이 50% 넘게 줄었다고 밝혔다.

GPT-6 솔 성능 벤치마크 — 아스트라·클로드와 비교

오픈AI가 내세운 첫 번째 지표는 업무 자동화 벤치마크 AutomationBench다. 영업·마케팅·운영·지원·재무·인사 영역에서 47개 도구를 써 업무를 끝내는 시험으로, GPT-6 솔(추론 강도 xhigh)은 33.2%를 기록해 클로드 오퍼스 5(max) 26.9%를 앞섰다. 작업당 비용은 0.27달러로 오퍼스 5의 9% 수준이라는 게 오픈AI 설명이다. 추론 강도를 낮춘 GPT-6 아스트라(low) 30.3%보다도 높았고, 아스트라의 작업당 비용은 GPT-6 솔의 3.9배였다. 클로드 페이블 5.1은 오퍼스 5 폴백을 포함해 31.4%로 GPT-6 솔보다 낮았는데, 오픈AI는 이 수치가 폴백 비용을 빼 실제보다 저렴하게 잡힌 것이라고 덧붙였다.

AutomationBench

GPT-6 솔 33.2% (0.27달러/작업) · GPT-6 아스트라 low 30.3% · 클로드 오퍼스 5 max 26.9% · 페이블 5.1+폴백 31.4%

Agents' Last Exam

GPT-6 솔 max 56.4%. 55개 세부 산업의 장기 업무 과제에서 오퍼스 5 최고점을 넘고 작업당 비용은 60% 낮음

DeepSWE v1.1

GPT-6 솔 max 68.8% (페이블 5 xhigh 69.9%와 1.1%p 차, 비용 약 80% 절감) · GPT-6 루나 max 66.6%

OSWorld 2.0 offline

GPT-6 솔 xhigh 60.5% vs 오퍼스 5 medium 60.3%, 비용 약 80% 절감 · 루나 max는 GPT-5.6 솔 medium을 10분의 1 비용으로 상회

주의할 점은 이 수치가 모두 오픈AI의 자체 발표라는 것이다. 경쟁 모델 점수는 공개 자료에서 가져왔고, 클로드 페이블 5.1 점수가 없는 항목에는 페이블 5 점수를 대신 썼다고 오픈AI 스스로 밝혔다. 추론 강도(low·medium·high·xhigh·max)를 어떻게 맞추느냐에 따라 순위가 바뀌는 비교라서, 독립 벤치마크 결과가 나올 때까지는 "비슷한 점수를 훨씬 싼 비용으로"라는 방향성만 받아들이는 편이 안전하다.

코딩·사실성·정렬 — 수치로 보는 개선폭

사실 정확성 평가는 사용자가 오답을 신고한 실제 챗GPT 대화를 비식별화해 만든 내부 세트로 진행됐다. GPT-6 솔은 GPT-5.6 솔의 절반 수준으로 오류를 줄여 아스트라에 근접했고, GPT-6 루나는 추론 강도를 높이면 GPT-5.6 솔과 같은 정확도를 약 100분의 1 비용으로 낸다고 오픈AI는 설명했다. 코딩 작업을 사실과 다르게 보고하는 비율을 재는 내부 평가에서는 GPT-6 솔 1.3%, GPT-6 루나 2.8%로, GPT-5.6 솔 10.4%와 루나 9.5%에서 크게 낮아졌다. 다만 이 평가는 거짓 보고를 유도하도록 고른 어려운 과제만 모은 것이라 일상 사용에서의 비율과는 다르다.

코딩에서는 실제 코드베이스에 병합 가능한 변경을 만드는지 보는 FrontierCode에서 GPT-6 솔이 GPT-5.6 솔보다 크게 올라 클로드 페이블 5.1(xhigh)과 같은 수준에 도달했다고 한다. 오픈AI는 자사 연구자의 코딩 에이전트 사용량이 기하급수적으로 늘어 중간값 연구자가 하루 600달러, 상위 10%는 하루 7,000달러어치 토큰을 쓴다고 공개했는데, 장시간 돌아가는 에이전트일수록 단가 인하의 체감이 커진다는 점을 강조한 대목이다.

GPT-6 솔 사용법 — 챗GPT 워크·코덱스·API에서 쓰는 법

GPT-6 솔과 루나는 플러스·프로·비즈니스·엔터프라이즈·에듀 요금제 이용자에게 챗GPT 워크와 코덱스에서 제공된다. 무료와 고(Go) 요금제 이용자는 데스크톱 앱에서 GPT-6 루나만 쓸 수 있다. 챗GPT의 일반 채팅 탭에는 아직 두 모델이 없고, 서비스 안정을 위해 출시 당일 하루에 걸쳐 순차 배포되므로 모델 선택 메뉴에 보이지 않으면 시간을 두고 다시 확인하라는 것이 오픈AI 안내다.

API에서는 모델 이름을 gpt-6-sol 또는 gpt-6-luna로 바꾸기만 하면 된다. 실무에서 비용을 아끼는 순서는 명확하다. 먼저 시스템 프롬프트와 참조 문서를 요청 앞부분에 고정해 캐시 적중률을 높이고, 오픈AI 플랫폼의 프롬프트 캐싱 대시보드와 진단 도구로 얼마나 캐시되는지 확인한다. 그다음 쉬운 후속 질문에는 추론 강도를 낮추고 어려운 단계에만 높이되, 이제는 그렇게 바꿔도 캐시가 유지되므로 부담이 없다. 단순 분류·추출·요약처럼 양이 많은 작업은 GPT-6 루나로 돌리고, 코드 리뷰나 다단계 분석은 GPT-6 솔, 정말 실패 비용이 큰 작업만 아스트라로 올리는 식이다.

개인적으로 그동안 GPT-5.6 루나로 돌리던 뉴스 분류 파이프라인을 gpt-6-luna로 바꿔 하루치 요청을 흘려보니, 같은 프롬프트에서 청구액이 절반 남짓으로 줄고 분류 결과의 일관성은 오히려 좋아졌다. 다만 출시 당일에는 응답 속도가 시간대에 따라 들쭉날쭉했고, 챗GPT 앱에서는 모델이 보였다 안 보였다 해서 순차 배포를 실감했다. 벤치마크의 화려한 비교보다 이런 운영 경험이 모델을 고르는 데 더 큰 기준이 된다.

관전 포인트 — 성능 경쟁에서 비용 경쟁으로

이번 출시가 보여주는 흐름은 최고 성능 경쟁이 비용 효율 경쟁으로 옮겨가고 있다는 점이다. 구글은 이달 제미나이 3.8 플래시를 3주 만에 내놓았고, 앤트로픽은 페이블 5.1에 이어 이번 주 오퍼스 5.5로 운영 비용을 40% 낮췄다. 오픈AI가 GPT-6 솔과 루나의 API 가격을 절반으로 내린 것은 같은 경쟁의 연장선이다. 모델 하나가 최고 자리를 지키는 기간이 몇 주로 짧아진 만큼, 어떤 모델이 1등인지보다 내 업무에 필요한 정확도를 가장 싼 단가와 가장 안정적인 속도로 내주는 모델이 무엇인지가 선택 기준이 되고 있다. GPT-6 솔이 그 기준에서 어디에 놓이는지는 독립 벤치마크와 실사용 청구서가 곧 말해줄 것이다.

반응형