월 300만 원의 토큰비가 현실이 된 시대


토큰은 대화 횟수가 아니라 AI의 실행 시간과 탐색량을 구매하는 생산수단으로 바뀌고 있습니다.
예전에는 과장이었지만, 지금은 가능한 비용입니다

과거에는 모델보다 사람의 입력과 확인 속도가 사용량의 상한을 만들었습니다.
몇 칠 전만 해도 “한 달에 AI 토큰 비용으로 300만 원을 썼다”는 말은 쉽게 믿기 어려웠습니다. 사람이 직접 질문을 입력하고 답을 기다리는 방식으로는 그렇게 많은 토큰을 꾸준히 소비하기 어려웠기 때문입니다.
당시의 병목은 모델이 아니라 사람이었습니다. 질문을 만들고, 답을 읽고, 다음 지시를 내리는 속도가 사용량의 상한을 만들었습니다. 고가 모델을 선택해도 사람이 잠들면 소비 역시 멈췄습니다.
GPT-6 Astra와 장시간 에이전트는 이 상한을 없애기 시작했습니다. 에이전트는 화면을 읽고, 도구를 호출하고, 실패 원인을 확인하고, 다시 수정합니다. 사람이 자리를 비운 뒤에도 이 과정이 이어집니다. 높은 추론 강도와 병렬 에이전트까지 더하면 월 300만 원은 과시를 위한 숫자가 아니라 실제 운영비가 될 수 있습니다.
변화의 핵심은 모델 가격만 오른 것이 아닙니다.
사람이 쉬는 동안에도 토큰을 소비하며 일을 계속할 수 있는 실행 구조가 만들어졌습니다.
관련 근거 · OpenAI ChatGPT·Codex 요금 및 사용량 안내 · Codex 20× 한도 소진 사용자 사례
Sol-Ultra까지 남아 있던 장벽을 Astra-Ultra가 넘었습니다

장시간 에이전트는 조사·실행·검토·수정을 사람이 자리를 비운 뒤에도 반복합니다.
Sol-Ultra도 많은 추론을 사용했지만, 일반 사용자가 구독 한도를 단시간에 소진하기는 상대적으로 쉽지 않았습니다. 작업이 중간에 끝나거나, 사람이 다음 지시를 내려야 하거나, 모델이 한 번의 응답 안에서 소비할 수 있는 계산량에 현실적인 제한이 있었기 때문입니다.
Astra-Ultra에서는 세 가지가 동시에 달라졌습니다. 더 긴 작업을 스스로 이어가고, 브라우저와 전문 소프트웨어를 직접 사용하며, 높은 추론 강도에서 시행착오를 반복합니다. 긴 문맥과 도구 결과가 계속 쌓이기 때문에 작업 후반으로 갈수록 한 번의 판단에 읽어야 할 정보도 많아집니다.
높은 추론 강도: 한 단계에서 더 많은 가설과 검토를 수행합니다. — 보이지 않는 추론 토큰이 늘어납니다.
장시간 에이전트: 실행·확인·수정을 사람 없이 반복합니다. — 사람의 입력 속도가 상한이 되지 않습니다.
큰 작업 문맥: 파일, 대화, 검색 결과, 도구 출력이 누적됩니다. — 후속 요청의 입력 비용이 커질 수 있습니다.
병렬 에이전트: 여러 접근법을 동시에 탐색합니다. — 시간은 줄지만 총 소비량은 빠르게 증가합니다.
실제 사용자 커뮤니티에서는 Astra가 Codex 20× 한도를 하루 만에 소진했다는 사례가 나왔습니다. OpenAI 관계자도 이후 파워유저의 장기 작업에서 구독 사용량 차감을 최대 3~4배 줄이는 개선을 했다고 밝혔습니다. 개인의 체감 사례만으로 모든 계정의 소비량을 일반화할 수는 없지만, 공급자도 장기 작업의 사용량 문제를 다루고 있다는 점은 분명합니다.
관련 근거 · OpenAI GPT-6 Astra 발표 · Astra 장기 작업 사용량 개선 안내 · 남은 사용량을 작업 예산으로 설정하는 사례
수학 난제에 ‘90억 원’을 썼다는 말은 어디까지 사실일까요

약 90억 원은 공개 API 가격을 적용한 소매가격 상당액이며 실제 인프라 지출액은 공개되지 않았습니다.
OpenAI는 2026년 9월 나비에–스토크스 밀레니엄 문제의 해법을 공개하면서 작업 규모도 함께 밝혔습니다. 약 1만 개의 에이전트가 동시에 움직였고, 해법에 도달하기까지 약 88시간이 걸렸습니다. 이 과정에서 에이전트들은 270만 개의 메시지를 주고받고 약 1,300억 개의 출력 토큰을 사용했습니다.
여기에 Astra의 공개 API 출력 가격인 100만 토큰당 50달러를 단순 적용하면 650만 달러입니다. 환율을 달러당 1,380원으로 가정하면 약 89억 7천만 원입니다. 온라인에서 말하는 ‘90억 원’은 이 계산에서 나왔습니다.
1,300억 출력 토큰 ÷ 100만 × 50달러
= 650만 달러 ≈ 89억 7천만 원
하지만 이것을 OpenAI가 실제로 결제한 금액이라고 부르면 부정확합니다. 해법을 만든 시스템은 Astra가 아니라 OpenAI가 “Astra보다 훨씬 강력하다”고 설명한 차세대 내부 모델이었습니다. Astra는 이후 17시간 동안 Lean 형식화와 검증에 사용됐습니다. 내부 모델의 가격과 실제 인프라 원가는 공개되지 않았습니다.
따라서 안전한 표현은 “공개된 토큰 수를 Astra의 소매 API 출력 가격으로 환산하면 약 90억 원 규모”입니다. 해법 역시 OpenAI가 발표한 결과이며, 수학계의 충분한 독립 검토가 끝났다는 뜻으로 받아들여서는 안 됩니다.
관련 근거 · OpenAI 나비에–스토크스 해법 및 작업 규모 · GPT-6 Astra API 가격

대규모 병렬 탐색은 더 많은 가설을 동시에 시험하지만 총 토큰 소비량도 크게 키웁니다.
이제 효율은 ‘토큰을 적게 쓰는 능력’만 뜻하지 않습니다

에이전트 시대에는 토큰당 효율과 사람 시간당 효율을 함께 평가해야 합니다.
토큰 효율은 보통 같은 답을 더 적은 토큰으로 만드는 능력을 뜻했습니다. 이 기준은 여전히 중요합니다. 불필요한 문맥과 반복 호출은 비용과 지연을 함께 키우기 때문입니다.
그러나 에이전트 시대에는 다른 효율도 봐야 합니다. 토큰을 많이 사용하더라도 사람이 며칠 동안 해야 할 탐색과 실행을 몇 시간 안에 끝낸다면, 조직 전체에서는 더 경제적일 수 있습니다. 토큰 비용 300만 원으로 1,000만 원 이상의 노동이나 몇 달의 탐색을 대체한다면 토큰당으로는 비싸도 사람 시간당으로는 효율적입니다.
토큰당 효율: 같은 결과를 얼마나 적은 토큰으로 만들었는가 — 짧게 끝났지만 결과가 쓸모없을 수 있습니다.
완료 과업당 효율: 검증된 결과 하나를 얻는 데 얼마가 들었는가 — 실패한 시도까지 함께 계산해야 합니다.
사람 시간당 효율: 사람의 개입과 대기시간을 얼마나 줄였는가 — 검토와 복구에 든 시간도 포함해야 합니다.
탐색 범위당 효율: 주어진 시간에 몇 개의 접근법을 검증했는가 — 병렬화가 중복 작업을 만들 수 있습니다.
Vals AI가 진행한 이른바 ‘토큰맥싱’ 실험에서는 일부 엔지니어가 하루 10억~20억 토큰을 사용했고, 한 엔지니어는 하루 60억 토큰을 기록했다고 소개됐습니다. 한 달간 사용한 토큰의 환산가치는 약 150만 달러로, 같은 기간 직원 급여의 약 10배였다고 합니다. 특정 회사의 제한된 실험이므로 일반적인 평균으로 볼 수는 없지만, 토큰 비용이 인건비와 같은 경영 항목으로 올라오기 시작했음을 보여줍니다.
관련 근거 · Vals AI 토큰맥싱 실험 요약 · Vals AI 인터뷰 및 사용량 사례
토큰은 사용량 단위에서 생산수단으로 바뀌고 있습니다

같은 모델을 사용해도 실행 시간과 병렬성, 실패를 감당할 예산에 따라 탐색 능력은 달라집니다.
같은 모델을 사용할 수 있다고 해서 같은 결과를 만들 수 있는 것은 아닙니다. 한 사람은 하나의 에이전트를 두 시간 실행하고, 다른 조직은 1만 개의 에이전트가 88시간 동안 서로 다른 접근법을 탐색하게 할 수 있습니다. 두 사용자는 모델 이름만 같을 뿐 실제로 접근할 수 있는 지능의 총량은 다릅니다.
이 차이를 ‘토큰권력’이라고 부를 수 있습니다. 모델 접근권 위에 추론 강도, 실행 시간, 병렬성, 실패를 감당할 예산이 다시 계층을 만듭니다. 과거의 디지털 격차가 인터넷과 소프트웨어에 접속할 수 있는가의 문제였다면, 에이전트 시대의 격차는 지능을 얼마나 오래 반복 호출할 수 있는가의 문제가 됩니다.
같은 모델에 접속하는 것과 같은 탐색 능력을 갖는 것은 다릅니다.
토큰 예산은 시도할 수 있는 가설의 수와 실패를 견딜 수 있는 횟수를 결정합니다.
그렇다고 토큰을 많이 태우면 자동으로 좋은 결과가 나온다는 뜻은 아닙니다. 중복된 에이전트, 커진 문맥, 잘못된 완료 기준은 거대한 비용만 남길 수 있습니다. 토큰권력은 소비 능력과 함께 결과를 평가하고 중단할 수 있는 운영 능력까지 포함합니다.
관련 근거 · 1만 에이전트·1,300억 출력 토큰 사례 · 모델·문맥·추론·도구에 따른 사용량 안내
앞으로 필요한 능력은 토큰 예산을 설계하는 일입니다

강한 모델은 결과 가치가 큰 문제에 집중하고, 비용과 중단 조건은 작업 전에 설계해야 합니다.
이제 좋은 프롬프트 하나만으로 생산성을 설명하기 어려워졌습니다. 어떤 일에 Astra-Ultra를 투입하고, 어떤 일은 더 작은 모델에 맡길지 결정해야 합니다. 어느 시점에 병렬 에이전트를 늘리고, 무엇을 통과하면 작업을 끝낼지도 미리 정해야 합니다.
기업의 AI 비용 관리 역시 월 구독료를 세는 방식에서 바뀌어야 합니다. 모델별 사용량뿐 아니라 완료된 과업, 절약된 사람 시간, 재작업률, 실패한 시도, 검토 비용을 함께 기록해야 합니다. 그래야 토큰을 많이 쓴 팀과 실제 성과를 낸 팀을 구분할 수 있습니다.
개인에게도 같은 원칙이 적용됩니다. 일상적인 정리와 초안은 가벼운 모델로 처리하고, 복잡한 설계·연구·검증처럼 결과 가치가 큰 구간에 강한 모델을 집중하는 편이 낫습니다. 장시간 작업에는 남은 사용량이나 최대 비용을 중단 조건으로 넣어야 합니다.
에이전트 시대의 경쟁력은 토큰을 무제한으로 쓰는 데 있지 않습니다.
가장 가치 있는 문제에 충분한 추론을 배치하고, 결과가 나오지 않는 소비를 멈추는 데 있습니다.

경쟁력은 토큰을 무제한으로 쓰는 데 있지 않고 지능을 어디에 얼마나 배치할지 결정하는 데 있습니다.
토큰은 이제 대화 횟수를 세는 단위가 아닙니다. AI 노동시간과 탐색량을 구매하는 계산자본이 되고 있습니다. GPT-6 Astra가 보여준 변화는 더 똑똑한 모델의 등장만이 아니라, 지능을 실제 생산량으로 바꾸는 비용 구조의 등장입니다.
관련 근거 · OpenAI 사용량 절감 권고와 토큰·크레딧 기준 · GPT-6 Astra 장시간·도구 기반 작업 안내
출처 및 참고
OpenAI, GPT-6 Astra 발표 · OpenAI, 나비에–스토크스 해법 발표 · GPT-6 Astra 모델·API 가격 · ChatGPT Work·Codex 요금과 사용량 · Astra 구독 한도 소진 사례 · Astra 사용량 개선 안내 · Vals AI 토큰맥싱 인터뷰 요약
초안·발행 유의사항
이 글에서 약 90억 원은 1,300억 출력 토큰에 Astra의 공개 소매 API 가격을 적용한 환산값이며 OpenAI의 실제 지출액이 아닙니다. 구독 한도 소진과 토큰맥싱 사례는 개별 사용자 및 특정 조직의 경험이므로 일반 사용자의 평균 소비량으로 해석하지 않습니다. 나비에–스토크스 결과는 OpenAI가 공개한 해법으로, 독립적인 학계 검토가 충분히 완료됐다는 의미는 아닙니다.