추론 모델(Claude Opus, o3)을 도입한 팀이 공통적으로 겪는 충격이 있다. 첫 청구서를 받고 나서야 "왜 이렇게 비용이 많이 나왔지?"라고 묻는 것이다. 일반 모델과 달리 추론 모델은 응답을 생성하기 전에 사고 토큰(thinking token)을 소비하는데, 이 토큰이 출력 토큰과 동일한 단가로 과금된다. 추론 모델을 실무에서 제대로 쓰려면 이 비용 구조를 먼저 이해해야 한다.사고 토큰이 비용 구조를 바꾼다일반 LLM은 입력 토큰과 출력 토큰, 두 가지만 청구된다. 추론 모델에는 세 번째 항목이 추가된다. 문제를 풀기 위해 내부적으로 소비되는 사고 토큰이다. 모델은 잠정 결론을 세우고 반례를 찾으며 스스로 검증하는 루프를 반복하는데, 이 과정 전체가 과금 대상이다. 복잡한 문제에서는 사용자가 ..