O desenvolvedor Simon Willison anunciou em 9 de outubro de 2026 o lançamento da versão 1.0 do ttok, utilitário de linha de comando que conta e trunca textos com base em tokens — as unidades mínimas que modelos de linguagem usam para processar informação. O anúncio foi publicado às 00h34 no blog do autor, que viu na troca de um comportamento padrão o pretexto adequado para finalmente carimbar a primeira versão estável do projeto, hospedado no GitHub.
O que a ferramenta faz
O ttok serve para medir e cortar texto por tokens, e não por caracteres ou palavras. Na prática, responde a perguntas cotidianas de quem trabalha com modelos de linguagem: quantos tokens tem determinado arquivo, quanto do limite de contexto ele ocupa e em que ponto exato o texto precisa ser interrompido.
O uso descrito pelo próprio autor é típico de um utilitário de terminal: ele atualiza as ferramentas instaladas, canaliza um arquivo para o programa e lê o resultado. A versão anterior, o ttok 0.4, havia saído apenas um dia antes, em 8 de outubro de 2026.
O detalhe que virou versão 1.0
A história da 1.0 começa nesse lançamento de véspera. Depois de publicar o 0.4, Willison rodou o comando de atualização da ferramenta, passou um arquivo pela nova versão e percebeu o problema: o ttok vinha configurado por padrão para usar o tokenizer do GPT-4, quando o mais coerente, na avaliação dele, seria assumir como padrão o tokenizer da família GPT-5 e também o do GPT-6.
Trocar esse comportamento pareceu justificativa suficiente para encerrar o ciclo de versões incrementais e publicar a 1.0, a primeira do projeto.
OpenAI não confirmou, mas há evidências
A escolha convive com uma pendência. Segundo Willison, a OpenAI ainda não confirmou oficialmente que o GPT-6 utiliza o mesmo tokenizer da família GPT-5, e o tema rende uma discussão bastante exaltada no repositório do tiktoken, a biblioteca de tokenização associada à empresa, a issue 608.
O assunto, portanto, segue sem palavra final da fabricante.
Para sustentar a decisão, o autor cita um commit de William Liu no projeto token-count-compare, que registra um experimento conduzido por ele. No teste, sete modelos GPT, 5.5, 5.6 nas variantes Sol, Terra e Luna, e 6 nas variantes Astra, Sol e Luna, reportaram 44.794 tokens cada um e coincidiram entre si em todas as 31 fixtures avaliadas.
A conclusão anotada é de que o GPT-6 não introduz mudança na contagem de entrada nesse corpus, o que reforça a hipótese de tokenizers equivalentes.
Por que isso importa
Contagem de tokens não é um detalhe cosmético: ela define quanto texto cabe na janela de contexto, quanto custa cada chamada a um modelo pago e onde um pipeline precisa truncar conteúdo para não estourar limites. Quando uma ferramenta de medição assume por padrão um tokenizer antigo, como o do GPT-4, os números que ela devolve podem não corresponder ao comportamento real dos modelos mais recentes, e decisões de orçamento, de arquitetura de aplicação e de fragmentação de documentos passam a se apoiar em estimativas desalinhadas.
O episódio também ilustra um atrito recorrente entre a velocidade dos lançamentos e a transparência técnica. Como a OpenAI não documentou publicamente a continuidade do tokenizer no GPT-6, a comunidade passou a produzir suas próprias verificações, com testes comparativos entre modelos e conjuntos fixos de amostras.
É esse tipo de evidência indireta que sustenta escolhas de padrão em ferramentas abertas, uma solução pragmática, mas que pode ser revista caso a fabricante confirme um comportamento diferente.
A 1.0 do ttok nasce, assim, menos como um salto de funcionalidades e mais como um ajuste de padrão fundamentado em experimentos de terceiros. Para quem depende de contagens precisas antes de enviar texto a um modelo, a mudança reduz o risco de trabalhar com estimativas herdadas de gerações anteriores, ainda que a confirmação oficial sobre o GPT-6 permaneça pendente.
Fontes e links
- Simon Willison, matéria original sobre o ttok 1.0
- ttok 1.0, página oficial do lançamento no GitHub
- Issue 608 no repositório OpenAI/tiktoken, discussão sobre o tokenizer do GPT-6
- Commit de William Liu, experimento com 31 fixtures e 44.794 tokens







