<aside> 💡
과금 방지 목적의 LLM 비용 최적화 및 측정기
LLM API 앞단에서 동작하는 스트리밍 프록시
</aside>
일단 걸어둔 제약
처음 이 프로젝트를 생각했을 때, 이 그림같은 흐름으로 생각을 했었다.

그런데 비용 산정에 2가지 문제가 있었다.
Claude의 경우, 질문의 토큰 수를 정확히 계산하려면 따로 API를 호출해야 한다.
토크나이저 자체를 제공하지 않는다.
최대라고 예상해도 최대라고 확신할 수 없다.
→ 토큰 조각으로 어떤 것들이 있는지 알 수 없기 때문
최대로만 예상 가능한 가능한 요소들이 존재한다.
결국, 통제 가능한 것은 LLM API 호출 시의 요청 데이터 뿐이다.
→ 동일한 문장을 최소한의 토큰으로 LLM이 이해하게끔 할 수는 없을까?
출처: 한국정보기술진흥원 뉴스
“커뮤니티 벤치마크와 학술 연구를 종합하면, 같은 의미를 전달할 때 영어 사용자가 100토큰으로 하는 대화를 한국어로는 300~500토큰을 써야 한다.”
위 뉴스에는 한국어가 불리한 이유로 3가지 이유를 제시한다.
결과적으로, LLM과 영어로 대화해야 토큰을 아낄 수 있다고 한다.
그럼 한글로 작성된 문장 자체를 최적화할 수는 없을까?