Codex로 프로그램을 만들다 보면 모델 선택 창 앞에서 잠깐 멈추게 된다. 복잡한 코딩이라면 GPT-6 Astra를 고르는 편이 마음은 편하지만, 버튼 하나를 옮기거나 오류 메시지를 바꾸는 일에도 매번 가장 강한 모델이 필요한 것은 아니다.
GPT-6.1 Sol이 나온 뒤에는 선택이 조금 달라졌다. OpenAI는 이 모델을 복잡한 코딩에서 Astra에 가까운 성능을 더 낮은 비용으로 제공하는 모델로 설명한다. 그렇다면 일반적인 개발 작업에서 Astra Low를 습관적으로 선택하기보다 Sol Medium부터 시작해 볼 만하다. 다만 두 설정의 성능이 같다는 뜻은 아니다. GPT-6.1 Sol 모델 안내도 실제 작업에서 Astra와 비교하라고 권한다.
먼저 비교표부터
여기서 reasoning effort(추론 수준)는 모델이 답을 내기 전에 문제를 얼마나 깊게 살펴볼지 정하는 설정이다. Light는 짧고 명확한 작업, Medium은 일반적인 개발, High는 어려운 문제를 떠올리면 된다. Codex 화면의 Light는 API·CLI 문서의 low에 해당한다. OpenAI의 Codex 모델 안내는 추론 수준을 올리면 복잡한 작업에 도움이 될 수 있지만 시간과 토큰 사용이 늘 수 있다고 설명한다.
| 모델 | 추론 수준 | 상대적인 성능 | 상대적인 토큰 사용량 | 적합한 작업 |
|---|---|---|---|---|
| GPT-5.4 Sol Light | Light | 이전 세대의 가벼운 기준 | 낮음 | 과거의 단순 수정 기준점 |
| GPT-5.4 Sol Medium | Medium | 이전 세대의 일반 작업 기준 | 보통 | 과거의 기능 수정·코드 분석 기준점 |
| GPT-6.1 Sol Light | Light | 명확한 작업에 충분한 편 | 낮음 | UI·문구·작은 함수 수정 |
| GPT-6.1 Sol Medium | Medium | 일반 개발의 균형점 | 보통 | 기능 추가·여러 파일 수정·버그 수정 |
| GPT-6.1 Sol High | High | 복잡한 추론에 유리 | 높음 | 어려운 버그·구조 변경 |
| GPT-6 Astra Low | Low | 강한 기본 능력에 낮은 추론 수준 | 낮음~보통 | 모호한 요구사항·난도 높은 작업 |
| GPT-6 Astra Medium | Medium | 가장 까다로운 작업에 유리 | 보통~높음 | 대규모 설계·여러 시스템의 문제 |
표의 성능과 토큰 사용량은 공식 벤치마크 점수나 보장된 소비량이 아니라, 작업 난이도에 따른 선택 기준이다. 같은 Medium이라도 모델과 작업에 따라 실제 추론 토큰은 달라진다. 출력이 짧고 재시도가 적은 Astra 작업이 긴 Sol 작업보다 총 토큰을 적게 쓸 수도 있다. OpenAI는 이 일곱 설정을 같은 작업에서 직접 비교한 수치를 공개하지 않았다. 추론 수준을 높일 때의 일반적인 경향은 reasoning 안내를 참고했다.
또한 표의 ‘GPT-5.4 Sol’은 비교를 위한 편의상 표기다. 공식 API 모델 ID는 gpt-5.4이며, ChatGPT 계정으로 로그인하는 Codex에서는 2026년 8월 31일 사용이 종료되었다. 현재 설정을 되돌려 선택하라는 의미가 아니다. API 키로 사용하는 Codex와 API의 제공 여부는 별개다. Codex 모델 목록과 사용 종료 안내
GPT-5.4에서 얼마나 나아졌을까?
GPT-5.4도 여러 파일을 다루고 코드를 수정할 수 있는 모델이었다. GPT-6.1 Sol의 변화는 이런 작업을 비용까지 고려하면서 더 어려운 단계까지 맡겨볼 수 있게 된 것에 가깝다. OpenAI는 GPT-6.1 Sol을 ‘Astra에 가까운’ 복잡한 작업용 모델로 분류하지만, GPT-5.4 대비 코딩 성공률이 몇 퍼센트 높아졌는지, 같은 작업에서 추론 토큰을 몇 퍼센트 덜 쓰는지는 공개된 자료만으로 말할 수 없다. GPT-5.4 모델 안내, GPT-6 모델 안내
실제로 느껴지는 차이는 작업을 맡길 때의 출발점이다. 예전에는 조금 복잡해 보이면 Astra Low나 Medium으로 바로 넘어갔다면, 이제는 Sol Medium으로 구현과 확인을 먼저 요청하고 결과를 살펴보는 방식이 합리적이다. 요구사항을 놓치거나 수정 범위가 커질 때 다음 단계로 올리면 된다. 이 판단은 공식 성능 수치가 아니라 위 모델 설명을 바탕으로 한 사용 전략이다.
Light → Medium → High → Astra로 올리기
GPT-6.1 Sol Light: 범위가 작고 답이 분명할 때
버튼 색상 변경, 문구 수정, 작은 함수의 조건문 수정처럼 어느 파일에서 무엇을 바꿀지 비교적 분명한 작업에 맞는다. 같은 규칙을 여러 파일에 반복 적용하는 일도 먼저 시도할 만하다.
예를 들어 “이 버튼의 문구를 바꾸고 모바일 화면에서 간격만 조정해 줘”라는 요청이라면 Light로 시작한다. 수정한 화면이나 테스트 결과를 확인해 필요한 부분만 다시 요청하면 된다.
GPT-6.1 Sol Medium: 일반적인 개발의 기본값
기능 추가, 여러 파일을 함께 수정하는 작업, 일반적인 버그 수정과 리팩터링에는 Medium을 기본값으로 권한다. 기존 코드를 읽고 UI와 로직을 함께 바꾸는 작업도 여기서 시작한다. 모델이 관련 파일을 찾고 변경 범위를 계획할 여지가 필요하기 때문이다.
가령 “검색창을 추가하고 입력값에 따라 목록을 걸러 줘. 모바일 화면도 확인해 줘”라면 Light보다 Medium이 어울린다. Astra Low를 항상 쓸 필요 없이 Sol Medium으로 먼저 시도하면 많은 일상적인 작업에서 사용량 대비 결과가 좋을 수 있다. 다만 이것은 작업별로 확인할 가설이지, Sol Medium = Astra Low라는 등식이 아니다.
GPT-6.1 Sol High: 여러 번 시도해도 풀리지 않을 때
원인을 찾기 어려운 버그, 여러 모듈에 걸친 수정, 프로그램 구조 변경에는 High로 올린다. Medium에서 수정만 반복되고 같은 오류가 되돌아온다면, 이전에 시도한 방법과 오류 로그를 정리해 High에 전달하는 편이 좋다.
예를 들어 “로그인 후 가끔 세션이 풀리는데 재현 조건을 찾고 서버와 프런트엔드의 상태 흐름을 함께 점검해 줘” 같은 요청이다. 높은 추론 수준은 시간을 더 들여 원인과 대안을 살펴볼 수 있지만, 항상 더 좋은 결과를 보장하지는 않는다.
GPT-6 Astra Low/Medium: 정확도가 더 중요할 때
Sol High에서도 해결되지 않거나, 대규모 아키텍처 변경처럼 잘못된 판단의 수정 비용이 큰 작업에는 Astra를 고른다. 여러 시스템이 연결되어 있고 요구사항도 모호하다면 Astra Low부터, 긴 맥락을 유지하면서 설계·구현·검증을 끝까지 이어야 한다면 Medium을 고려한다. OpenAI 역시 Astra를 가장 어려운 종단 간 작업에 적합한 모델로 안내한다. 모델 선택 안내
Astra Low와 Sol Medium 중 어느 쪽이 효율적일까?
강한 모델의 낮은 추론 수준과 조금 더 저렴한 모델의 중간 추론 수준은 서로 다른 선택이다. Astra Low는 모델 자체의 능력을 활용해 빠르게 핵심을 잡을 수 있다. Sol Medium은 한 단계 낮은 모델에 더 많은 추론 여유를 주는 방식이다.
평범한 기능 수정에서는 Sol Medium이 한 번에 충분한 결과를 낼 수 있다. 반대로 원인이 흐릿한 버그나 여러 도구를 오가며 판단해야 하는 작업에서는 Astra Low가 적은 재시도로 끝날 수 있다. 그러면 더 비싼 모델을 골랐더라도 작업 전체의 시간과 사용량은 오히려 줄어들 수 있다. OpenAI도 Astra가 일부 평가에서 더 적은 출력 토큰으로 강한 결과를 냈다고 설명한다. GPT-6 모델 안내
그래서 모델을 비교할 때는 한 번의 답변 길이만 보지 않는다. 원하는 결과까지의 재시도 횟수, 실제 코드의 정확성, 테스트 통과 여부, 걸린 시간을 함께 본다. 자주 하는 작업이라면 같은 종류의 요청 몇 개를 Sol Medium과 Astra Low에 각각 맡겨 비교해 볼 만하다.
토큰 가격과 Codex 사용량은 다르다
토큰은 모델이 읽고 쓰는 텍스트를 나누어 세는 단위다. API에서는 입력 토큰과 출력 토큰에 각각 가격이 붙는다. 2026년 9월 30일 기준, 일반적인 길이의 요청에 대한 표준 API 가격은 GPT-6.1 Sol이 입력 100만 토큰당 $2, 출력 100만 토큰당 $10, GPT-6 Astra가 각각 $10, $50이다. 캐시, 긴 문맥, 처리 방식에 따라 가격은 달라진다. GPT-6.1 Sol 가격, GPT-6 Astra 가격
여기에 모델이 답을 내기 전에 사용하는 추론 토큰이 있다. reasoning effort를 올리면 대체로 추론량과 시간이 늘지만, 요청마다 실제 소비량이 달라 High는 Medium의 두 배처럼 계산할 수 없다. API의 모델별 단가, 실제 추론량, ChatGPT 계정으로 로그인한 Codex에서 체감하는 사용량·한도는 서로 다른 기준이다. API 가격의 비율을 Codex 화면의 사용량 비율로 그대로 옮겨서는 안 된다. reasoning 안내, Codex 모델 안내
VS Code에서 새 모델 선택하기
VS Code의 Extensions에서 게시자가 OpenAI인 Codex – OpenAI’s coding agent를 찾는다. 설치된 확장에 업데이트가 있다면 적용한 뒤 Codex 패널을 다시 열고, 입력창 아래의 모델 이름을 눌러 목록을 확인한다. 첨부한 화면처럼 확장 상세 페이지에서 공식 게시자를 확인할 수 있다.

OpenAI 게시자의 Codex 확장을 확인하는 화면. 아직 업데이트를 하지 않았거나 자동 업데이트가 되지 않은 사람에게는 Update라는 버튼이 보인다. 새 모델이 보이는지는 확장 버전뿐 아니라 계정과 배포 상태에도 달려 있다.

입력창 아래의 모델 이름을 누르면 선택 목록이 열린다. 캡처 시점과 계정에 따라 표시되는 모델은 다를 수 있다.
모델 선택 목록에서 GPT-6.1 Sol이 제공되면 선택하고, 이어서 Light·Medium·High 중 작업에 맞는 수준을 고른다. 목록에 Astra와 GPT-6 Sol, GPT-5.6 계열만 보인다면 GPT-6.1 Sol이 아직 해당 환경에 표시되지 않은 것이다. 업데이트 후에도 없다면 계정·조직 설정과 순차 배포 여부를 확인한다. OpenAI는 사용 가능한 모델이 요금제, 클라이언트, 조직 설정, 배포 시점에 따라 달라진다고 안내한다. Codex 모델 안내, IDE 확장 안내
내가 고르는 순서
Codex에는 계정에 따라 주간 사용량 한도가 적용될 수 있다. 평소 주간 사용량을 다 쓰지 못하고 남아돌았다면 기존처럼 써도 문제가 없겠지만, 사용량이 늘 빠듯했다면 Astra Low 대신 Sol Medium을 기본값으로 써볼 만하다.
다만 GPT-6.1 Sol이 출시된 지 얼마 되지 않았으니, 한 달 정도 이리저리 사용해 보며 효율적인 값으로 조정하려 한다. 우선 작업 난이도에 따라 다음과 같이 골라 볼 생각이다.
단순 수정 → GPT-6.1 Sol Light
일반적인 개발 → GPT-6.1 Sol Medium
어려운 문제 → GPT-6.1 Sol High
그래도 해결되지 않음 → GPT-6 Astra Low/Medium
처음부터 가장 강한 모델을 고르기보다, 작업에 필요한 만큼 추론 수준과 모델을 단계적으로 올리는 방식이 토큰을 효율적으로 쓰는 출발점이라고 생각한다. 다만 재시도 비용이 큰 작업이라면 처음부터 Astra를 선택하는 편이 더 효율적일 수도 있다.
참고로 웹버전 메인화면도 오늘 대대적으로 개편되었고 예약이라는 기능이 생겼는데, 메일을 분석해서 내가 대응해야 하는 메일을 주기적으로 알려달라고 해놓은 상태이다.