강사용 상세본 · AI LABS · 2026-07-23

Hermes Agent
토큰비용
확 줄이기

장시간 돌아가는 에이전트의 비용은 “프롬프트 몇 글자”가 아니라, 매 턴 같이 따라오는 시스템 프롬프트·스킬 헤더·MCP 도구·메모리·대화 히스토리·백그라운드 잡에서 터진다.

선정 영상: Use This To Make The Hermes Agent Basically Free 13:08 원본 보기

수업용 보조 영상

이 교안 내용을 1분 18초 뉴브루탈리즘 자막형 하이라이트 영상으로 요약했다. 수강생용 웹사이트 교안에는 같은 MP4가 함께 포함된다.

MP4 보기

한 줄 결론

비용 최적화는 모델을 싸게 쓰는 문제가 아니라, 에이전트가 언제 읽고, 언제 압축하고, 언제 멈추는지를 통제하는 문제다.

수업 목표

1. 비용 발생원을 분해한다

입력 토큰 = 사용자 프롬프트 + 시스템 지시 + 대화 히스토리 + 스킬/MCP/메모리.

2. 싼 모델이 맡을 일을 나눈다

auxiliary 작업, 스킬 검색, MCP 로드, 단순 프로필 작업은 메인 모델이 아니어도 된다.

3. 컨텍스트를 다이어트한다

compression threshold와 target ratio를 낮춰 긴 대화가 매 턴 비싸지는 걸 막는다.

4. 멈춤 조건을 박는다

max turns 150 → 60, hard stop true, cron max turns 상한으로 무한 루프를 자른다.

핵심 자막 근거

“the input isn't just your prompt... the system prompt and the whole conversation... the header of each skill... the MCP tools... memory and user files.”

즉, “질문 하나”를 보낸 것처럼 보여도 실제로는 운영체제 전체가 같이 딸려간다. 스킬이 많고, 메모리가 크고, MCP가 많이 열려 있고, 대화가 길수록 매 턴 비용이 오른다.

토큰 줄이는 5개 레버

LEVER 01

Usage DB + insights

먼저 어디서 많이 쓰는지 본다. 최근 30일 비용, 많이 쓴 툴·스킬·활동 패턴부터 확인.

LEVER 02

Auxiliary 모델 다운

이미지 읽기, 스킬 검색, MCP 로드, 프로필 설명 같은 잡일은 저렴한 모델로 돌린다.

LEVER 03

Compression 빠르게

긴 대화는 요약 세션으로 갈아타고, 남기는 비율도 낮춘다. 메모리는 짧고 정확하게.

LEVER 04

안 쓰는 도구 끄기

필요 없는 tools, skills, MCP는 끄고 tool search는 auto로 둔다. 항상 로드되는 표면을 줄인다.

LEVER 05

Hard limit

max turns, max tokens, hard stop, cron 상한을 박아 백그라운드 폭주를 차단한다.

OPENCLAW 주의

복붙 금지

영상은 Hermes 기준이다. OpenClaw에 넣을 땐 config schema와 실제 키명을 확인해야 한다.

실습 체크리스트

1. 최근 30일 토큰/비용 로그를 먼저 뽑는다.
2. auxiliary·subagent·cron 모델이 메인 모델로 새는지 본다.
3. 메모리/SOUL/USER 파일에서 장황한 문장을 줄인다.
4. MCP와 스킬은 “항상 켜기”가 아니라 “필요할 때 검색”으로 바꾼다.
5. max turns, hard stop, cron 상한을 모든 장기 작업에 건다.

강사용 멘트

“에이전트 비용은 전기세랑 비슷해요. 전등 하나 켠 줄 알았는데, 알고 보니 온 집안 조명과 보일러가 같이 켜져 있던 겁니다. 그래서 첫 단계는 더 싼 전구를 사는 게 아니라, 어디가 계속 켜져 있는지 보는 거예요.”

Source: learning-agent-vault/_system/daily-ai-tips/2026-07-23.md · 원본 영상: https://youtu.be/5d02TYoOzfE