2026.10.05 07:57 AM

기업들 AI 비용 예측 '속수무책'...싼 모델이 오히려 14배 비싸질 수도

By 전재희

기업 396곳 조사, AI 비용을 오차 10% 이내로 예측한 곳은 11%뿐
저가 AI 모델, 복잡한 작업서 더 오래 추론하면 고가 모델보다 실제 비용 커져
같은 모델·같은 질문도 실행 때마다 토큰 사용량 달라...전통적 소프트웨어 예산방식 흔들려
기업들 "직원들에게 AI 많이 쓰라" 독려했다가 청구서 받고 비용통제 본격화 

기업들의 인공지능(AI) 도입이 빠르게 확대되고 있지만, 이를 실제로 운영하는 데 얼마나 많은 돈이 필요한지를 예측하는 것은 갈수록 어려워지고 있다.

AI 서비스가 기존 소프트웨어처럼 사용자 한 명당 일정한 월 사용료를 내는 방식이 아니라, 모델이 사용하는 '토큰(token)'의 양과 작업 과정에 따라 비용이 달라지기 때문이다.

더 큰 문제는 같은 업무를 같은 AI 모델에 맡기더라도 매번 사용하는 토큰과 작업 단계가 달라질 수 있다는 점이다.

인공지능
(인공지능. 자료화면)

이 때문에 기업들은 AI를 적극 도입하면서도 다음 달 또는 다음 분기에 얼마의 비용이 청구될지 정확히 계산하기 어려운 상황에 놓이고 있다.

월스트리트저널(WSJ)에 따르면 최근 약 400개 기업을 대상으로 한 조사에서 AI 지출을 비교적 정확하게 예측한 기업은 10곳 가운데 1곳 정도에 불과했다.

기업 89%, AI 비용예측 10% 이상 빗나가

AI 비용관리업체 Mavvrik과 Benchmarkit이 올해 4~5월 396개 기업을 대상으로 실시한 '2026 State of AI Cost Governance Report'에 따르면 실제 AI 지출을 예상치의 ±10% 범위 안에서 맞힌 기업은 11%에 불과했다.

39%는 실제 비용이 예측치에서 11~25% 벗어났고, 35%는 26~50% 차이가 났다.

13%는 실제 지출이 예상치보다 50% 이상 벗어났다.

아예 AI 비용예측 자체를 하지 않은 기업도 2%였다.

결국 전체 기업의 89%가 AI 지출예측을 두 자릿수 이상 틀린 셈이다.

조사에서는 예상하지 못한 AI 비용 때문에 실제 사업결정을 바꾼 기업도 62%에 달했다. 81%는 AI 비용이 제품의 매출총이익률을 낮추고 있다고 답했다.

처음에는 "AI 최대한 많이 써라"

기업들이 AI를 처음 도입했을 때만 해도 분위기는 정반대였다.

직원들에게 가능한 한 많은 업무에 AI를 활용해보라고 독려했다.

업계에서는 이를 '토큰 맥싱(tokenmaxxing)'이라고 부르기도 했다.

문서를 요약하고 이메일을 작성하는 단순한 업무에서부터 프로그래밍과 데이터 분석, 시장조사, 고객서비스, 보고서 작성까지 AI를 적극적으로 사용하도록 한 것이다.

기업 입장에서는 AI를 많이 사용할수록 직원 생산성이 향상되고 새로운 업무방식을 빠르게 찾을 수 있을 것이라는 기대가 컸다.

그러나 실제 사용량이 늘어난 뒤 문제가 나타났다.

청구서였다.

AI 비용의 핵심 단위 '토큰'

생성형 AI 서비스는 일반적으로 토큰을 기준으로 비용을 계산한다.

토큰은 AI가 텍스트를 읽고 생성할 때 사용하는 정보의 기본 단위다.

사용자가 질문을 입력하면 입력문 자체도 토큰으로 계산되고, AI가 답변을 생성하면 그 답변 역시 토큰을 사용한다.

최근의 추론형 AI 모델은 여기에 또 하나의 비용이 추가된다.

답을 내놓기 전에 내부적으로 여러 단계의 추론을 수행하기 때문이다.

복잡한 문제일수록 AI가 더 오랫동안 판단하고 여러 경로를 시험하며 외부 도구나 웹사이트를 호출할 수 있다.

결국 사용자가 보는 답변은 몇 문장에 불과해도 그 답변을 만들어내는 과정에서는 수천 또는 수만개의 토큰이 사용될 수 있다.

AI는 기존 소프트웨어와 다르다

기존 기업용 소프트웨어는 비교적 예산을 잡기 쉽다.

예를 들어 직원 1인당 매월 50달러를 받는 소프트웨어를 직원 1천명이 사용한다면 월 비용은 약 5만달러다.

사용자가 약간 늘더라도 비용을 어느 정도 예상할 수 있다.

AI는 그렇지 않다.

같은 직원이 같은 시스템을 사용하더라도 업무 난이도와 AI의 행동에 따라 비용이 크게 달라질 수 있다.

WSJ은 AI 비용을 인간 근로자와 비교했다.

예를 들어 잔디를 깎는 사람에게 시간당 20달러를 지급한다고 가정해보자.

첫 주에는 작업을 두 시간 만에 끝내 40달러가 들었다.

그런데 다음 주에는 같은 일을 하는 데 8시간이 걸려 160달러가 나온다.

셋째 주에는 5시간 동안 일했지만 잔디 절반밖에 깎지 못할 수도 있다.

현재의 AI 비용구조가 이와 비슷하다는 설명이다.

"싼 모델이 반드시 싼 것은 아니다"

기업들이 흔히 저지르는 실수 가운데 하나는 토큰당 가격이 낮은 AI 모델을 선택하면 전체 비용도 줄어들 것이라고 생각하는 것이다.

하지만 실제 연구결과는 그렇지 않았다.

스탠퍼드대와 카네기멜런대, UC버클리, 마이크로소프트 리서치 연구진은 올해 수학과 프로그래밍, 과학 등 다양한 작업에서 AI 모델들의 실제 비용을 비교했다.

연구진은 표시된 API 단가가 낮은 모델이 반드시 총비용까지 낮은 것은 아니라는 '가격 역전(price reversal)' 현상을 확인했다.

마이크로소프트 리서치가 공개한 연구에서는 모델 간 비교의 약 21.8%에서 표시가격이 더 싼 모델의 실제 실행비용이 오히려 더 높게 나타났다.

특정 작업에서는 모델별 실제 비용 차이가 최대 28배까지 벌어졌다.

WSJ이 더 넓은 테스트 데이터를 분석한 결과에서도 저가 모델이 고가 모델보다 실제로 더 많은 비용을 발생시킨 경우가 약 32%에 달했다.

1달러짜리 AI가 성공, 싼 모델은 14달러 쓰고 실패

가장 극적인 사례는 구글의 Gemini 모델 비교에서 나타났다.

연구진은 유튜브 영상 한 장면을 분석하는 동일한 업무를 Gemini 3.1 Pro와 보다 가볍고 저렴한 Gemini 3 Flash에 맡겼다.

일반적으로 Pro 모델은 복잡한 추론과 판단이 필요한 업무용이고 Flash는 빠르고 저렴한 모델이다.

가격표만 보면 Flash가 훨씬 저렴하다.

그러나 실제 작업에서는 정반대 결과가 나왔다.

Gemini 3.1 Pro는 85단계 만에 작업을 성공적으로 끝냈다.

총 비용은 약 1달러였다.

반면 Gemini 3 Flash는 거의 1천단계를 거쳤다.

싼 모델, 952단계 돌고도 실패

Flash 모델은 작업을 해결하려고 여러 방법을 반복적으로 시도했다.

영상파일을 내려받고 검색을 진행하고 다른 챗봇과 검색엔진을 활용했다.

250단계, 500단계, 750단계를 넘어가면서도 정답을 찾지 못했다.

결국 952단계에 이르러 입력 토큰이 허용된 최대치를 넘어섰다는 오류와 함께 작업에 실패했다.

그동안 발생한 비용은 약 14달러였다.

결과적으로 표시가격이 더 싼 모델은 14달러를 사용하고 실패했고, 상대적으로 비싼 모델은 1달러만 사용하고 성공했다.

즉 단순한 토큰 단가만 보면 훨씬 비싼 모델이 전체 업무비용에서는 14분의 1 수준이었던 셈이다.

왜 싼 모델이 더 비싸질까

이유는 AI가 해결해야 하는 문제와 모델의 능력이 맞지 않을 수 있기 때문이다.

성능이 높은 모델은 토큰 한 개당 가격이 비싸더라도 문제를 빠르게 이해하고 짧은 경로로 해결할 수 있다.

반면 가벼운 모델은 토큰 가격은 싸지만 문제를 제대로 해결하지 못하면서 같은 작업을 반복하거나 여러 도구를 계속 호출할 수 있다.

결국 '토큰 가격 × 사용 토큰 수'가 실제 비용이기 때문에 싼 토큰을 훨씬 많이 사용하면 전체 비용이 더 커진다.

연구를 주도한 링자오 천(Lingjiao Chen)은 "실질적인 결론은 분명하다"며 표시가격만으로 어떤 모델이 실제로 더 저렴한지를 판단해서는 안 된다고 말했다.

연구진도 표시된 API 가격은 실제 실행비용을 예측하는 신뢰할 만한 지표가 아니며, 업무별 비용을 고려한 모델 선택이 필요하다고 결론지었다.

같은 AI에 같은 질문해도 비용이 다르다

기업 입장에서는 더 어려운 문제가 있다.

모델 간 비용 차이뿐 아니라 같은 모델도 매번 다른 비용을 발생시킨다는 것이다.

연구진은 OpenAI와 구글, 앤트로픽의 여러 모델에 동일한 프로그래밍 문제를 각각 다섯 차례 반복해서 입력했다.

그 결과 같은 질문과 같은 AI 모델을 사용했는데도 매번 비용이 달라졌다.

어떤 실행은 빠르게 문제를 해결했고, 다른 실행에서는 훨씬 많은 추론과 작업단계를 거쳤다.

연구에서는 동일 질문을 반복했을 때 추론 토큰 사용량이 최대 9.7배까지 달라지는 경우가 확인됐다.

실패해도 돈은 나간다

AI 비용관리에서 특히 까다로운 점은 작업에 실패했다고 해서 비용이 사라지는 것이 아니라는 점이다.

AI가 수백번의 판단과 도구호출을 한 뒤 잘못된 답을 내놓거나 작업 자체를 완료하지 못하더라도 그 과정에서 사용한 토큰 비용은 그대로 청구된다.

기업이 AI를 고객서비스나 프로그래밍, 데이터 분석과 같이 대량으로 실행되는 업무에 활용할 경우 이 차이는 매우 커질 수 있다.

AI 에이전트 수천개가 매일 수백만건의 작업을 수행하는 기업이라면 작은 비용 차이도 연간 수백만달러 규모로 확대될 수 있다.

'AI 에이전트' 확산하면서 비용문제 더 커져

특히 기업들이 단순 챗봇보다 AI 에이전트를 사용하기 시작하면서 비용관리는 더욱 어려워지고 있다.

기존 챗봇에서는 사람이 질문을 입력하고 AI가 한 번 답하는 경우가 많았다.

AI 에이전트는 다르다.

사용자가 목표를 주면 AI가 스스로 작업계획을 세우고 여러 시스템을 돌아다니며 필요한 정보를 찾는다.

검색하고, 프로그램을 실행하고, 결과를 확인하고, 잘못되면 다시 시도한다.

따라서 사용자가 한 번 업무를 요청했더라도 내부에서는 수십번 또는 수백번의 AI 호출이 발생할 수 있다.

Mavvrik 조사에서도 기업들의 비용 가시성이 가장 떨어지는 분야 가운데 하나가 바로 에이전트형 AI 워크플로였다.

일반 퍼블릭 클라우드 비용을 제대로 파악하고 있다는 기업은 67%였지만 에이전트형 AI와 GPU 인프라 비용을 제대로 파악하고 있는 기업은 36%에 불과했다.

개발자 AI 비용도 '사각지대'

코딩용 AI 도구도 빠르게 확산되고 있다.

Mavvrik 조사에서는 응답 기업의 98%가 AI 코딩 도구를 사용하고 있었다.

그러나 이 비용을 공식 AI 비용보고에 포함한 기업은 42%에 불과했다.

즉 개발자들이 AI를 적극적으로 사용하고 있지만 상당수 기업의 재무부서에서는 그 비용이 전체적으로 얼마나 되는지 제대로 파악조차 하지 못하고 있는 셈이다.

이는 AI 도입이 기술부서의 실험단계를 넘어 기업 전체의 비용구조에 영향을 미치는 단계에 진입했음을 보여준다.

예상보다 큰 AI 청구서가 사업계획까지 바꿔

문제는 단순히 IT 부서의 예산 초과에 그치지 않는다.

Mavvrik 조사에서는 기업의 62%가 예상하지 못한 AI 비용 때문에 실제 사업결정을 변경한 경험이 있다고 답했다.

일부 기업은 AI가 포함된 제품 가격을 올렸고, 일부는 경영진이나 이사회 차원의 검토에 들어갔다.

AI 프로젝트 자체를 중단한 기업도 있었다.

기업이 고객에게 AI 기능을 월 20달러에 제공했는데 실제 사용자가 발생시키는 AI 비용이 25달러라면 고객이 늘어날수록 회사의 손실도 커질 수 있다.

전통적인 소프트웨어에서는 사용자가 늘수록 추가비용이 크게 늘지 않는 경우가 많았지만 생성형 AI에서는 사용자가 많아질수록 추론비용도 직접 늘어난다.

AI 기업조차 비용예측 제대로 못해

흥미로운 점은 AI를 전문적으로 다루는 기업들도 상황이 크게 다르지 않다는 것이다.

Mavvrik 보고서에서는 AI 네이티브 애플리케이션 기업 가운데 실제 지출을 ±10% 이내로 예측한 비율이 불과 3%였다.

오히려 전체 조사대상 평균인 11%보다 낮았다.

절반 이상의 AI 네이티브 기업이 자신의 AI 비용관리 능력을 '고급 수준'이라고 평가했지만 실제 예측 정확도는 가장 낮았다.

AI 활용이 많아질수록 비용구조가 복잡해진다는 의미로 볼 수 있다.

구글 "대규모 사용에서는 변동성 평균화"

AI 업체들은 개별 작업의 비용이 크게 달라질 수 있다는 점을 인정하면서도 대규모 실제 업무에서는 이런 변동성이 일정 부분 평균화된다는 입장이다.

구글은 WSJ에 개별 프롬프트 수준에서 어느 정도의 변동성은 AI의 본질적인 특성이라면서, 다양한 실제 업무를 대량으로 처리하면 이러한 차이가 평균화되는 경향이 있다고 설명했다.

구글은 또한 하나의 작업에 들어가는 전체 비용은 여러 요소에 의해 결정되기 때문에 새롭게 발전하는 기술의 비용을 정확히 예측하기 어려울 수 있다고 밝혔다.

기업 고객에게는 지출상한과 유연한 가격정책 등 비용통제 기능도 제공하고 있다고 설명했다.

기업이 해야 할 일은 '무조건 싼 모델' 선택이 아니다

이 때문에 기업들의 AI 비용관리 전략도 바뀌어야 한다는 지적이 나온다.

첫 번째는 모든 업무에 동일한 모델을 사용하지 않는 것이다.

단순한 이메일 요약이나 문서분류에는 빠르고 저렴한 모델을 사용하고 복잡한 분석과 프로그래밍, 판단업무에는 성능이 높은 모델을 사용하는 방식이다.

하지만 여기에서도 단순히 "가벼운 업무=싼 모델"이라는 원칙만 적용해서는 안 된다.

실제 업무별 성공률과 평균 토큰 사용량, 반복실행 횟수까지 측정해야 한다.

모델 가격보다 '업무 한 건당 비용' 봐야

기업이 봐야 할 지표는 토큰당 가격이 아니라 실제 업무 한 건을 성공적으로 끝내는 데 얼마가 드는가다.

예를 들어 A모델의 비용이 토큰당 1이고 B모델은 5라고 해도 A모델이 작업을 해결하기 위해 20배 많은 토큰을 사용한다면 B모델이 더 싸다.

여기에 실패율까지 포함하면 격차는 더 커진다.

즉 AI 비용관리의 기준은 '가장 싼 모델'이 아니라 '해당 업무에서 성공까지 드는 총비용'이 돼야 한다.

마이크로소프트 리서치 연구도 같은 결론을 내렸다. 연구진은 가격표만 비교하기보다 실제 요청 단위의 비용을 모니터링하고 업무에 맞는 모델을 선택해야 한다고 지적했다.

직원 교육도 비용관리의 일부

기업이 직원들에게 AI를 어떻게 사용해야 하는지를 교육하는 것도 중요해지고 있다.

예를 들어 간단한 번역이나 이메일 문장수정을 최고성능 추론모델에 맡길 필요는 없다.

반대로 복잡한 프로그램 오류 해결이나 법률·재무 분석을 지나치게 약한 모델에 맡기면 AI가 같은 문제를 수십번 반복하면서 오히려 비용이 커질 수 있다.

직원들이 업무 종류에 따라 어느 모델을 사용해야 하는지 알고 있어야 AI 비용을 줄일 수 있다는 것이다.

과거 기업의 IT 교육이 보안과 소프트웨어 사용법에 집중됐다면 앞으로는 'AI 모델 선택법'까지 비용관리의 중요한 부분이 될 가능성이 있다.

CFO에게 AI는 새로운 비용항목

AI 비용문제는 이제 최고기술책임자(CTO)나 IT 부서만의 문제가 아니다.

최고재무책임자(CFO)에게도 중요한 문제가 되고 있다.

AI 기능을 제품에 넣을 경우 고객 한 명을 서비스하는 비용이 얼마인지 알아야 제품가격을 결정할 수 있다.

하지만 AI 비용을 제대로 예측하지 못한다면 정확한 매출총이익률이나 투자수익률(ROI)도 계산하기 어렵다.

Benchmarkit의 레이 라이크(Ray Rike) 최고경영자는 AI의 ROI를 논의하려면 먼저 비용을 정확히 알아야 한다며 비용 가시성이 불완전한 상태에서는 상당수 AI 투자수익률 계산이 가정에 의존할 수밖에 없다고 지적했다.

전통적인 '소프트웨어 경제학'과 다른 AI

생성형 AI가 기업 IT시장에 가져온 가장 중요한 변화 가운데 하나는 소프트웨어 비용구조 자체가 달라졌다는 점이다.

전통적인 클라우드 소프트웨어는 한 번 개발한 뒤 고객이 늘어나도 추가 서비스 비용이 비교적 적게 증가하는 경우가 많다.

AI는 고객의 요청이 들어올 때마다 실제 컴퓨팅 자원을 사용한다.

복잡한 추론모델일수록 GPU와 전력, 데이터센터 자원을 더 많이 사용한다.

따라서 AI 사용량이 두 배가 되면 비용 역시 상당 부분 함께 증가할 수 있다.

기업 입장에서는 AI가 생산성을 높이는 동시에 새로운 형태의 변동비를 만들어내는 셈이다.

'AI 많이 써라'에서 '어떻게 써야 하나'로

기업들의 AI 도입전략도 이제 새로운 단계로 넘어가고 있다.

초기에는 직원들이 AI를 얼마나 많이 사용하는지가 중요했다.

AI 도입률과 사용량 자체가 혁신의 지표처럼 받아들여졌다.

하지만 대규모 청구서가 나오기 시작하면서 질문이 바뀌고 있다.

"AI를 얼마나 많이 사용하는가"가 아니라 "어떤 업무에 어떤 AI를 사용해야 가장 경제적인가"가 중요해진 것이다.

기업이 모델별 가격표만 보고 비용을 계산할 수 있었던 시대도 지나가고 있다.

같은 모델이라도 실행할 때마다 비용이 달라지고, 싼 모델이 더 많은 추론을 하다가 비싼 모델보다 큰 청구서를 만들 수 있기 때문이다.

AI 경쟁의 다음 단계는 '성능'에서 '비용통제'로

지금까지 AI 기업들의 경쟁은 대부분 어떤 모델이 더 똑똑한가에 집중됐다.

추론능력과 코딩성능, 수학 문제 해결능력, 이미지와 영상 이해능력이 주요 비교 대상이었다.

그러나 기업들이 AI를 실제 업무에 대규모로 배치하기 시작하면서 새로운 경쟁요소가 등장하고 있다.

얼마나 안정적으로 비용을 예측할 수 있는가다.

기업 고객에게는 단순한 최고성능보다 같은 업무를 반복했을 때 얼마나 일정한 비용과 품질로 처리할 수 있는지가 중요하기 때문이다.

결국 AI 산업이 실험단계를 넘어 본격적인 기업 인프라로 자리 잡으면서 토큰 사용량과 모델 선택, 작업 성공률, 비용예측을 통합적으로 관리하는 'AI 비용 거버넌스'가 새로운 경영과제가 되고 있다.

Mavvrik 조사에서 기업의 89%가 AI 비용예측을 10% 이상 빗나갔다는 결과는 현재 기업들이 AI의 능력을 활용하는 속도에 비해 이를 관리하는 재무 시스템은 아직 따라가지 못하고 있음을 보여준다.

AI 도입의 다음 단계에서는 가장 강력한 모델을 보유한 기업만큼이나, 그 모델을 가장 효율적으로 사용하면서 비용을 통제할 수 있는 기업이 경쟁력을 갖게 될 가능성이 커지고 있다.