AI 에이전트를 위한 토큰 효율적 메모리 — JSON보다 22% 적은 토큰
토큰 효율이 중요한 이유
섹션 제목: “토큰 효율이 중요한 이유”AI 에이전트가 처리하는 모든 토큰은 비용이 발생하고 시간이 걸립니다. 에이전트가 세션 시작 시 메모리 파일을 읽을 때, 해당 파일의 형식은 다음에 직접적인 영향을 미칩니다:
- 비용 — 적은 토큰 = 더 낮은 API 요금
- 속도 — 적은 토큰 = 더 빠른 응답
- 컨텍스트 윈도우 — 적은 토큰 = 실제 작업을 위한 더 많은 공간
toon-memory는 TOON 형식(Token-Oriented Object Notation)을 사용하며:
- LLM 기반으로 JSON보다 22% 더 효율적
- AI 인식 최적화 — LLM이 정보를 처리하는 방식에 맞게 설계
- 무손실 — 데이터 손실 없음, 완전한 양방향 변환 지원
토큰 효율 벤치마크
섹션 제목: “토큰 효율 벤치마크”파일 수준 효율
섹션 제목: “파일 수준 효율”형식 토큰 (16개 항목) vs JSON────────────── ─────────────────── ───────JSON 1097 기준TOON 850 -22.5%세션 수준 영향
섹션 제목: “세션 수준 영향”방법 컨텍스트 확보 토큰 vs 파일 재읽기──────────────────────────── ───────────────────── ───────────────────소스 파일 재읽기 ~3000 기준memory_recall (플랫) ~1200 -60%memory_recall (그래프, 컴팩트) ~900 -70%memory_smart_recall ~850 -72%전체 세션 벤치마크
섹션 제목: “전체 세션 벤치마크”5단계 에이전트 세션 전체 시뮬레이션:
단계 메모리 없음 memory_recall 사용 context_* 도구 사용───────────────────────────────────── ───────────────── ───────────────── ─────────────────단계 1: 세션 시작 516 t / 6 c 409 t / 3 c 373 t / 1 c단계 2: 디버깅 176 t / 4 c 182 t / 2 c 252 t / 1 c단계 3: 기능 구현 189 t / 6 c 183 t / 3 c 305 t / 1 c단계 4: 코드 리뷰 316 t / 4 c 130 t / 2 c 243 t / 1 c단계 5: 마무리 1,214 t / 5 c 68 t / 2 c 117 t / 1 c───────────────────────────────────── ───────────────── ───────────────── ─────────────────합계 2,411 t / 25 c 972 t / 12 c 1,290 t / 5 c결과:
| 지표 | 메모리 없음 | memory_recall 사용 | context_* 도구 사용 |
|---|---|---|---|
| 세션당 토큰 | 2,411 | 972 (-60%) | 1,290 (-47%) |
| 세션당 도구 호출 | 25 | 12 (-52%) | 5 (-80%) |
| 세션당 비용 (GPT-4) | $0.072 | $0.029 | $0.039 |
TOON 형식 작동 원리
섹션 제목: “TOON 형식 작동 원리”기존 JSON
섹션 제목: “기존 JSON”{ "id": "a1b2c3d4", "category": "decision", "key": "use-zod", "content": "Use Zod for validation", "file": "src/types.ts", "tags": "validation;types", "date": "2026-07-10"}TOON 형식
섹션 제목: “TOON 형식”a1b2c3d4|decision|use-zod|Use Zod for validation|src/types.ts|validation;types|2026-07-10TOON 형식은:
- 구분자로
|사용 ("와:보다 적은 토큰) - 문자열에 따옴표 없음
- 중괄호 없음
- 간결하지만 사람이 읽을 수 있음
토큰 효율적 recall 모드
섹션 제목: “토큰 효율적 recall 모드”플랫 모드 (기본값)
섹션 제목: “플랫 모드 (기본값)”memory_recall({ query: "redis" })// 전체 상세 정보와 함께 일치하는 항목 반환그래프 모드
섹션 제목: “그래프 모드”memory_recall({ query: "redis", mode: "graph", hops: 2 })// 그래프 연결을 통해 관련 항목 확장컴팩트 모드
섹션 제목: “컴팩트 모드”memory_recall({ query: "redis", compact: true })// 숫자 인덱싱된 항목 반환, id/date/file 제외// 그래프 엣지는 ->2, ->3으로 렌더링스마트 recall (권장)
섹션 제목: “스마트 recall (권장)”memory_smart_recall({ intent: "데이터베이스 구성" })// 한 번의 호출로 BM25 + 그래프 + 품질 결합// 모든 작업 시작 시 사용각 모드 사용 시점
섹션 제목: “각 모드 사용 시점”| 모드 | 적합한 용도 | 토큰 비용 |
|---|---|---|
| 플랫 | 간단한 키워드 검색 | 보통 |
| 그래프 | 상호 연결된 결정 | 낮음 (컴팩트) |
| 컴팩트 | 토큰 제약이 있는 컨텍스트 | 가장 낮음 |
| 스마트 | 알 수 없는 검색어 | 보통 (포괄적) |
비용 절약 계산기
섹션 제목: “비용 절약 계산기”GPT-4 가격 기준 ($0.03/1K 입력 토큰):
| 시나리오 | 메모리 없음 | toon-memory 사용 | 절약액 |
|---|---|---|---|
| 하루 10세션 | $0.72/일 | $0.29/일 | $0.43/일 |
| 월 30세션 | $21.60/월 | $8.70/월 | $12.90/월 |
| 연 365세션 | $262.80/년 | $105.85/년 | $156.95/년 |
시작하기
섹션 제목: “시작하기”npm install -g toon-memorynpx toon-memory # 대화형 설치 프로그램다음 세션부터 에이전트는 토큰 효율적 메모리를 사용하게 됩니다.