toon-memoryDesenvolvido com TOON

A camada de continuidade para agentes de IA

O conhecimento do seu agente sobrevive a cada sessão — offline, privado, sem LLM.

Funciona com
OpenCodeVS Code / CopilotClaudeCursorWindsurf
+17 mais
~/.toon-memory

$npm install -g toon-memory

Por que os agentes perdem contexto entre sessões?

Agentes de IA começam cada sessão com amnésia

Contexto reseta diariamente

A cada nova sessão, seu agente esquece as decisões, padrões e bugs que aprendeu ontem. Você reexplica o mesmo contexto repetidamente.

Caçando no histórico

Sem memória, os agentes fazem grep no histórico do git e relêem arquivos para reconstruir por que algo foi feito de certa forma — gastando tokens e tempo.

Notas de copiar e colar

Desenvolvedores colam contexto manualmente entre chats. É frágil, fica obsoleto e nunca chega à próxima execução autônoma.

toon-memory dá ao seu agente uma memória persistente e consultável — para que o contexto sobreviva a cada sessão, automaticamente.

Conheça o toon-memory

A camada de continuidade para seu fluxo de trabalho

Enquanto uma memória armazena fatos, uma camada de continuidade preserva como seu projeto funciona — para que cada sessão comece onde a anterior terminou.

Decisões

O "porquê" por trás de cada escolha — frameworks, bibliotecas, trade-offs. Lembrado quando importa, nunca re-litigado.

📏

Convenções

Regras de nomenclatura, estrutura e estilo que seu time acordou. Seguidas sem precisar ser ditas de novo.

Contexto

Conhecimento de arquitetura, ambiente e operação que não vive em nenhum arquivo isolado.

🤝

Entendimento compartilhado

Conhecimento do projeto e decisões do time disponíveis para cada agente e cada sessão.

toon-memory introduz o conceito de camada de continuidade: um sistema leve que preserva conhecimento, decisões e contexto do projeto entre sessões de IA — sem serviços em nuvem nem infraestrutura pesada.

Por que os desenvolvedores escolhem o toon-memory

Privado, leve, universal

As garantias que tornam seguro manter a memória do projeto.

Privacidade em primeiro lugar

  • 100% local — sem nuvem, sem servidor, sem telemetria
  • Criptografia opcional AES-256-GCM
  • Você é dono do arquivo de memória, como qualquer fonte

Leve

  • Formato TOON nativo — 22% menos tokens que JSON
  • ~1 MB instalado — uma única dependência runtime, roda em qualquer Node.js 18+
  • Lógica determinística — sem chamadas LLM, sem chaves de API
🛰️

Universal

  • Funciona com 20+ agentes: Claude Code, Codex, Gemini CLI, Cursor, OpenCode e mais
  • MCP padrão — troque de agente sem perder contexto
  • Memória por projeto compartilhada por todo o time

Mesmo projeto. Duas sessões.

O que seu agente lembra muda o resultado.

Sem toon-memory
Sessão 1
Use Sequelize.
OK.
Mantido no contexto da sessão — acumula tokens.
Sessão 2
Qual é o nosso ORM?
Sem memória entre sessões.
Não sei.
Com toon-memory
Sessão 1
Use Sequelize.
$ memory_remember({ category: "decision", key: "orm:sequelize", content: "Usar Sequelize como ORM" })
OK.
Salvo na memória.
Sessão 2
Qual é o nosso ORM?
Recuperado da memória.
Você está usando Sequelize.

Benchmarks

Medido, não assumido

Economia de tokens e chamadas medida em uma sessão real

auto-loading
~90%

menos tokens

25 → 5
80%

menos chamadas

recall compacto
68%

menos tokens

system primer
58%

menos tokens

compressão em lote
14%

menos tokens

Formato TOON

O formato TOON é feito para LLMs, não para humanos

Métrica
menos tokens que JSON22.5%
em uma única entrada30.5%
mais rápido para parsear1.3x

JSON 1097TOON 850

Medido com gpt-tokenizer (cl100k_base) em 16 entradas de memória representativas, comparando o formato TOON real em disco contra JSON compacto. Reproduzível: npm run bench.

Qualidade do ranking

Busca estilo LongMemEval sobre snapshot real congelado de 187 entradas — 42 gold queries

MétricaLinearRRFUnificado
R@5· entrada gold no top 50.6430.8610.829
nDCG@5· qualidade do ordenamento0.6540.7640.739
MRR@5· posição do acerto0.7760.7880.760
97,6% das queries respondidas a partir do top-5

Snapshot real do data.toon (187 entradas, 2026-08-01), today determinístico, somente leitura e sem cópias; excluídas 2 meta-entradas priority. Reproduzível: npm run bench:retrieval.

Auto-loading: o plugin do OpenCode injeta apenas memória relevante ao arquivo em vez de despejar todas as entradas. Sessão completa: início → depuração → implementação → revisão → encerramento. Reprodutível: npm run bench:full, npm run bench:primer, npm run bench:compress-all.

Como funciona?

Quatro passos da amnésia à memória

1

Instalar

Um comando. Zero configuração para 20+ agentes.

npm install -g toon-memory
2

Lembrar

Salve decisões, padrões e bugs enquanto trabalha — com inferência automática de tags e TTL opcional.

memory_remember({
  category: "decision",
  key: "use-zod",
  content: "Use Zod for validation",
  file: "src/types.ts"
})
3

Recall

Seu agente consulta a memória sob demanda — sem reexplicar, sem desperdiçar tokens.

memory_recall({ query: "validation" })
// [decision] use-zod (a1b2c3d4)
//   Use Zod for validation — src/types.ts
4

Contexto

Uma chamada dá ao seu agente tudo: projeto, git, memória, sessões. 80% menos chamadas de ferramenta.

context_generate({})
// # Project Briefing (full)
// ## Project — toon-memory v4.3.0
// ## Git — branch: main, 3 commits
// ## Memory — 26 entries, 18 edges
// ## Sessions — 2 active

Multi-agente

Funciona com todos os principais agentes de IA. OpenCode, VS Code, Claude, Cursor, Windsurf, Cline, Continue — zero configuração.

OpenCodeClaudeCursor

Formato TOON

22% menos tokens que JSON (medido). Codificação personalizada projetada para compreensão de LLMs e eficiência de tokens.

22% menos tokens1.3x mais rápido para parsear

Recall inteligente

Recall baseado em grafo reordenado por relevância BM25 e centralidade do grafo (hubs aparecem mesmo sem a palavra de busca). Decaimento por hop mantém contexto distante baixo. Modo `compact` retorna resultados com índices numéricos e trechos.

BM25Centralidadecompact

Memória inteligente

Inferência automática de tags a partir de vocabulário integrado e dependências do projeto, pontuação de qualidade, escores de confiança, merge-dedup, sugestões de entradas relacionadas, diff de memória e TTL configurável para contexto temporário.

Auto-tagsQualidadeMerge-dedup

Criptografia

AES-256-GCM para dados sensíveis. Auto-arquivamento de entradas antigas. Modo watch para backup automático a cada N minutos.

AES-256-GCMAuto-backup

Sua memória, como um grafo

Conecte decisões a suas specs, bugs e arquitetura. O recall retorna o contexto correto — não apenas correspondência de palavras.

  • Vincule entradas com `links` ou referências `[[key]]` — sem embeddings, sem LLM
  • `memory_recall({ mode: "graph" })` expande um subgrafo consciente de relações
standard1097 tokens
memory_recall({ query: "riesgo", mode: "graph" })
[decision] risk-engine-priority (a1b2c3d4)
  The engine prioritizes risk over speed.
  File: spec.md:10 | Tags: risk;spec | Date: 2026-07-01
  links: engine-arch
compact: true~520 tokens
memory_recall({ query: "riesgo", mode: "graph", compact: true })
[1] decision/risk-engine-priority
  The engine prioritizes risk over speed.
  tags: risk;spec · edges: ->2, ->3
Dentro do visualizador:
BuscaLocalizador de caminhosExportar PNG / SVGTemas claro e escuro

Visualizador do grafo de memória

Visualize sua memória como um grafo interativo de força dirigida. Veja entradas, conexões, categorias e padrões de acesso de relance.

  • Visualizador CLI: npx toon-memory viewer inicia um servidor HTTP
  • Visualizador inline MCP Apps: chame memory_visualize() para renderizar o grafo diretamente em hosts compatíveis com MCP Apps — sem servidor
  • Passe o mouse sobre nós para tooltips com pré-visualização e pontuação de qualidade
  • Clique para selecionar e centralizar; duplo clique para abrir detalhes
  • A busca filtra entradas e destaca nós correspondentes com um brilho pulsante
  • O localizador de caminhos encontra e destaca a conexão mais curta entre duas entradas
  • Física ajustável, tema escuro/claro, exportação PNG/SVG

Um kit de memória

Tudo que seu agente precisa para lembrar, recuperar e raciocinar

Memória Principal

memory_remember

Salvar na memória

Armazena decisões, padrões, bugs, conhecimento ou warnings (memórias negativas "NÃO faça isso", recuperadas com impulso) — persistente entre sessões com pontuação de qualidade automática.

memory_recall

Buscar memória

Consulta o grafo de conhecimento antes de ler arquivos. Resultados ponderados por qualidade. Suporta path scoping (path_scope) e controle de orçamento (tiny/normal/deep). explain: true anexa uma linha de motivo por entrada; budget_tokens limita a saída por tokens estimados.

memory_stats

Estatísticas

Mostra estatísticas da memória do projeto, incluindo distribuição de qualidade, entradas mais acessadas e métricas de hit-rate/duplicatas/obsoletas.

Busca & Inteligência

memory_smart_recall

Recall inteligente

Busca unificada combinando BM25 + centralidade + qualidade + frescor em uma chamada. Suporta explain: true (motivos por entrada) e budget_tokens (limite de saída).

memory_consolidate

Consolidar

Mescla entradas duplicadas com conteúdo idêntico, detecta quase-duplicatas via similaridade Jaccard (>50%), remove entradas de baixa qualidade em lote ou aposenta entradas de versões antigas de bibliotecas (mode: "versions") — via parâmetro mode, sem LLM.

Briefing de Contexto

context_generate

Briefing completo

Briefing em uma chamada: estrutura do projeto + estado git + memória + sessões. Substitui 6 chamadas manuais. Economiza 93% tokens.

context_health

Auditoria de saúde

Links órfãos, duplicatas, referências quebradas, TTL expirados, sessões obsoletas. Nota 0–100.

Compressão

memory_compress

Compressão LLM

Compressão em duas etapas com LLM: resumir + sobrescrever. Usa Anthropic/OpenAI CLI se disponível.

memory_primer

Primer de contexto

Primer de contexto em uma chamada: memórias principais + categorias + alterações de arquivos da sessão. Injetado automaticamente no início da sessão.

Sessões

memory_sessions

Sessões

Mostra sessões ativas do agente e detecta conflitos leves.

memory_merge_sessions

Mesclar sessões

Mescla observações entre sessões paralelas para um arquivo. Deduplica e promove automaticamente.

Sincronização & Segurança

memory_encrypt

Ativar criptografia

Criptografia AES-256-GCM com chave auto-gerada.

memory_backup

Backup da memória

Cria backup com timestamp do arquivo de memória. Auto-poduz para os 10 mais recentes.

Recursos:memory-entriesmemory-statsmemory-summariesmemory-viewer (ui://viewer)

Funciona com 20+ agentes de IA

Zero configuração — toon-memory detecta e configura cada um automaticamente

OpenCodeOpenCode
VS Code / CopilotVS Code / Copilot
ClaudeClaude
CursorCursor
WindsurfWindsurf
ClineCline
ContinueContinue
CodexCodex
GeminiGemini
ZedZed
AntigravityAntigravity
AiderAider
KiloCodeKiloCode
OpenClawOpenClaw
KiroKiro
QwenQwen
KimiKimi
GooseGoose
JunieJunie
AmpAmp
GrokGrok
TraeTrae

Perguntas frequentes

Tudo que você precisa saber para dar memória ao seu agente

O que é toon-memory?

Uma camada de memória persistente para agentes de IA com 35 ferramentas MCP. Armazena decisões, padrões, bugs e contexto em um formato TOON compacto para que seu agente lembre tudo entre sessões — com 80% menos chamadas de ferramenta por sessão.

Quais agentes são suportados?

OpenCode, VS Code, Claude Code, Cursor, Windsurf, Cline, Continue, Codex, Gemini, Zed, Antigravity, Aider, KiloCode, OpenClaw e Kiro — 20+ agentes com zero configuração via servidor MCP.

Como meus dados são armazenados?

Entradas são gravadas em um arquivo TOON local (um formato eficiente em tokens ~22% menor que JSON, medido). Você é dono do arquivo e pode commitar, diffar ou fazer backup como qualquer outro arquivo fonte.

Minha memória é criptografada?

Sim. Ative a criptografia com a ferramenta memory_encrypt para proteger entradas sensíveis com AES-256-GCM. A chave é gerada automaticamente e mantida local.

Funciona offline?

Completamente. toon-memory roda localmente sem serviços externos ou contas. O modo watch até cria backups automáticos em horário agendado.

Vários agentes podem compartilhar a mesma memória?

Sim. Como a memória vive em um arquivo simples no seu projeto, cada agente configurado para aquele projeto lê e escreve o mesmo contexto.

Como faço backup da minha memória?

Use o modo watch para backups automáticos agendados, ou simplesmente commite o arquivo TOON no git. Entradas antigas são auto-arquivadas após 30 dias para manter tudo limpo.

É gratuito e open source?

Sim. toon-memory é licenciado MIT e gratuito. O código está no GitHub e o pacote é publicado no npm.

Como isso difere da memória embutida do meu agente?

A memória embutida geralmente é efêmera ou específica do fornecedor. toon-memory dá a você um arquivo de memória portátil, com diff e criptografado que você controla totalmente entre agentes e projetos.

Posso expirar contexto temporário?

Sim. Defina um TTL (ex: ttl: "7d") em qualquer entrada e ela expira automaticamente — perfeito para sprints, prazos e notas sensíveis ao tempo.

O que é smart recall?

memory_smart_recall combina busca BM25 por palavras-chave, centralidade do grafo, pontuação de qualidade e decaimento de frescor em uma chamada — o melhor de todas as estratégias de ranking sem orquestração manual.

Como funciona a pontuação de qualidade?

Cada entrada recebe automaticamente uma pontuação de qualidade (0-1) baseada em cobertura de tags, riqueza de links, detalhe do conteúdo, frescor e especificidade. Entradas de alta qualidade aparecem primeiro nos resultados.

O que acontece se eu salvar a mesma chave duas vezes?

O sistema mescla atributos em vez de substituir: tags e links são unidos, qualidade e confiança tomam o máximo, e a data é atualizada. Sua entrada fica mais rica com o tempo.

O que é compressão de memória?

memory_compress permite que um LLM resuma entradas relacionadas em um resumo conciso. memory_consolidate(mode: "low-quality") remove entradas de baixa qualidade (sem tags, conteúdo curto) de forma determinística — sem LLM. Ambas reduzem a contagem de tokens.

Posso sincronizar a memória entre máquinas?

Sim. Use memory_export_gist para enviar entradas para um GitHub Gist, depois memory_import_gist em outra máquina. As entradas são mescladas automaticamente (união de tags, confiança máxima).

Pronto para dar continuidade ao seu agente?

Instale em segundos e nunca mais reexplique seu projeto.