Hermes Agent
토큰비용
확 줄이기
장시간 돌아가는 에이전트의 비용은 “프롬프트 몇 글자”가 아니라, 매 턴 같이 따라오는 시스템 프롬프트·스킬 헤더·MCP 도구·메모리·대화 히스토리·백그라운드 잡에서 터진다.
1분 요약 영상
아래 영상은 이 교안 내용을 1분 18초 자막형 하이라이트로 요약한 버전이다.
MP4 새 창으로 보기한 줄 결론
비용 최적화는 모델을 싸게 쓰는 문제가 아니라, 에이전트가 언제 읽고, 언제 압축하고, 언제 멈추는지를 통제하는 문제다.
수업 목표
1. 비용 발생원을 분해한다
입력 토큰 = 사용자 프롬프트 + 시스템 지시 + 대화 히스토리 + 스킬/MCP/메모리.
2. 싼 모델이 맡을 일을 나눈다
auxiliary 작업, 스킬 검색, MCP 로드, 단순 프로필 작업은 메인 모델이 아니어도 된다.
3. 컨텍스트를 다이어트한다
compression threshold와 target ratio를 낮춰 긴 대화가 매 턴 비싸지는 걸 막는다.
4. 멈춤 조건을 박는다
max turns 150 → 60, hard stop true, cron max turns 상한으로 무한 루프를 자른다.
핵심 자막 근거
즉, “질문 하나”를 보낸 것처럼 보여도 실제로는 운영체제 전체가 같이 딸려간다. 스킬이 많고, 메모리가 크고, MCP가 많이 열려 있고, 대화가 길수록 매 턴 비용이 오른다.
토큰 줄이는 5개 레버
Usage DB + insights
먼저 어디서 많이 쓰는지 본다. 최근 30일 비용, 많이 쓴 툴·스킬·활동 패턴부터 확인.
Auxiliary 모델 다운
이미지 읽기, 스킬 검색, MCP 로드, 프로필 설명 같은 잡일은 저렴한 모델로 돌린다.
Compression 빠르게
긴 대화는 요약 세션으로 갈아타고, 남기는 비율도 낮춘다. 메모리는 짧고 정확하게.
안 쓰는 도구 끄기
필요 없는 tools, skills, MCP는 끄고 tool search는 auto로 둔다. 항상 로드되는 표면을 줄인다.
Hard limit
max turns, max tokens, hard stop, cron 상한을 박아 백그라운드 폭주를 차단한다.
실제로 적용하는 법 — 위에서부터 순서대로
앞의 두 단계는 설정을 전혀 건드리지 않습니다. 대부분 여기서 해결돼요. 3단계는 그래도 부담될 때만.
대화방을 주제별로 나누기
한 방에서 계속하면 비서가 매번 그 방 전체를 다시 읽습니다. 길어질수록 매 턴이 비싸져요. “소재 찾는 방”, “글 쓰는 방”처럼 나누세요. 효과가 가장 크고, 잘못될 위험이 없습니다.
길어진 방은 압축
입력창에 / 를 치면 명령 목록이 뜹니다. 거기서 압축(compress)을 실행하면
지금까지 대화가 요약본으로 바뀌어 다음 턴부터 가벼워져요. 안 쓰는 방은 그냥 정리하시고요.
큰 결과물이 매 턴 따라다니는 것 막기
터미널 출력·파일 읽기·웹 스크랩 같은 덩치 큰 결과가 대화에 계속 따라붙어서 매 턴 다시 전송됩니다. 이걸 자동으로 정리해주는 기능이 있는데 기본값이 꺼져 있어요.
비서에게 아래를 그대로 붙여넣으세요.
토큰 비용을 줄이려고 해. 아래를 순서대로 해주고 결과를 알려줘. 1) 지금 값 확인 hermes config get compression.proactive_prune_tokens 2) 값이 0이면(꺼져 있으면) 48000으로 켜줘 hermes config set compression.proactive_prune_tokens 48000 3) 바뀐 값을 다시 확인해서 보여줘
왜 안전한가 — 이 정리는 AI를 한 번도 더 부르지 않습니다(공식 문서: “never calling the model”). 그래서 켜는 것 자체로 드는 비용이 없어요. 최근 대화는 건드리지 않고, 정리된 원본도 나중에 다시 꺼내볼 수 있습니다. 48000은 공식 문서가 제시한 권장값이에요(“try 48000 to enable”).
되돌리려면 hermes config unset compression.proactive_prune_tokens
prune 이 뭔가요
가지치기라는 뜻이에요. 요즘 모델은 기억할 수 있는 양이 넓어서 기본 압축이 거의 안 걸립니다. 그러다 보니 덩치 큰 결과가 대화에 계속 얹혀서 매 턴 다시 전송돼요. 그걸 걷어내는 기능입니다.
하는 일은 셋이에요 — 똑같은 결과 중복 제거 · 오래되고 큰 것 요약 · 큰 호출 인자 잘라내기.
48000 은 무슨 숫자인가요
토큰 수입니다. 다시 전송되는 분량이 48,000 토큰을 넘을 때 정리가 작동해요. 그 전까지는 아무것도 하지 않습니다. 낮추면 더 일찍, 높이면 더 늦게 작동해요.
왜 하필 이 숫자냐면 — 공식 문서가 “이 값으로 켜보라”고 제시한 시작값입니다 (원문: “default 0 = off; try 48000 to enable”). 그 이상의 근거는 문서에 적혀 있지 않아, 그대로 따르는 게 안전합니다.
안전장치 (공식 문서 기준)
- 최근 대화는 건드리지 않아요 — 기본 최근 20개 메시지 보호
- AI를 부르지 않아요 — 원문 “never calling the model”. 켜는 것 자체로 드는 비용 0
- 원본은 복구됩니다 — “Full outputs stay recoverable from the session store”
- 작은 결과는 손대지 않아요 — 8,000자 미만은 그대로 둠
- 이득이 적으면 실행 안 해요 — 4,096 토큰 이상 회수될 때만 반영
공식 문서 — Configuration 편 의 Context Compression 섹션 · GitHub 원문
⚠️ 여기까지만 하세요
위 영상에는 auxiliary 모델 분리 · 도구/스킬 끄기 · max turns · hard stop 같은 설정도 나옵니다. 그런데 이 설정들은 언제 반영되는지가 공식 문서에 명시돼 있지 않고, 잘못 건드리면 비서 동작이 이상해질 수 있어요.
공식 문서가 재시작 없이 즉시 반영된다고 보장하는 건 compression 관련 설정뿐입니다. 나머지는 “usual reload paths”가 필요하다고만 적혀 있어요. 지금 단계에서는 1·2단계로 충분합니다.
설정 근거 — Hermes Agent 공식 문서 Configuration 편
(compression.* 핫리로드 · hermes config get/set/unset) · 원본 영상: Use This To Make The Hermes Agent Basically Free