Na última sexta-feira, Simon Willison encerrou o WeAreDevelopers World Congress North America, em San Jose, com uma palestra que percorreu cronologicamente tudo o que aconteceu no universo dos modelos de linguagem em 2026 até agora. O texto com os slides anotados foi publicado em 27 de setembro de 2026, e a gravação está disponível no YouTube.
O recado central: o ano ainda não terminou, mas a combinação entre modelos e agentes de código já mudou de patamar.
O gatilho veio ainda em 2025
Para Willison, 2026 começou dois meses antes, em novembro de 2025, quando foram lançados o Claude Opus 4.5 e o GPT-5.1. Como costuma acontecer, eram melhorias incrementais sobre os modelos anteriores.
Mas, de tempos em tempos, uma melhoria faz o modelo cruzar uma linha invisível: algo que não funcionava passa a funcionar. No caso, o que passou a funcionar foram os agentes de codificação, o Claude Code, no ar desde fevereiro de 2025, e o Codex, um pouco mais novo.
Emparelhados com seus respectivos harnesses, os dois novos modelos deixaram de errar com frequência. Passaram a ser confiáveis o suficiente para o uso no dia a dia.
O pelicano e o repositório obscuro
Há alguns anos Willison avalia modelos com um pedido simples: gerar um SVG de um pelicano andando de bicicleta. Ele mesmo reconhece que é provavelmente o benchmark mais tolo do mundo.
Ainda assim, segue sendo um desafio: desenhar pelicanos é difícil, desenhar bicicletas é difícil e pelicanos não andam de bicicleta.
No estado da arte de novembro, o Claude ainda não conseguia desenhar direito uma bicicleta. O quadro da bicicleta do GPT-5.1 também deixava a desejar.
Ainda em novembro, houve o primeiro commit em um repositório obscuro do GitHub chamado Warelay, que o palestrante prometeu retomar mais adiante.
Dezembro, janeiro e a aposta na ambição
Com as férias de dezembro, desenvolvedores independentes tiveram tempo de experimentar essas novas combinações de modelos e agentes. Começou a ficar claro quanto eles conseguiam fazer que antes era inviável.
Em janeiro, muita gente estava ansiosa para colocar aquilo em prática.
Willison conta que sua resolução de ano novo sempre foi a mesma: manter o foco, assumir menos projetos e terminar o que já estava em andamento. Como isso nunca deu certo, decidiu fazer o oposto e abraçar quantos projetos quisesse.
O tema do ano, diz ele, passou a ser ser mais ambicioso: a única forma de encontrar os limites dessa tecnologia é continuar empurrando até que ela pare de funcionar.
Previsões, sandboxing e o desastre que não veio
Em 8 de janeiro de 2026, Willison participou do podcast Oxide and Friends, com Bryan Cantrill e Adam Leventhal, para fazer previsões sobre o ano, sobre três anos e sobre seis anos. Em retrospecto, considera suas apostas pouco ambiciosas.
Disse que se tornaria inegável que LLMs escrevem bom código, e avalia que já chegamos lá. Previu que finalmente resolveríamos o sandboxing: das 277 sessões da conferência, cerca de 40 tocavam de alguma forma em sandboxing ou segurança de agentes, sinal de que há bastante esforço concentrado no tema.
Também previu um desastre nos moldes do caso Challenger na segurança dos agentes de codificação. Houve muito ruído sobre segurança de agentes ao longo do ano, mas o desastre específico que ele imaginou, agentes sequestrados causando dano econômico no mundo real, não se concretizou.
Entre as previsões, havia ainda uma piada: a de que o Papa se pronunciaria sobre o impacto econômico dos LLMs.
Os kākāpō
Willison também previu que os papagaios kākāpō da Nova Zelândia teriam uma temporada reprodutiva excelente. São aves noturnas e incapazes de voar, que ele considera de aparência atarracada e bela, e havia apenas 236 exemplares no mundo no início do ano.
Os kākāpō só se reproduzem quando as árvores Rimu têm uma grande safra de frutos, algo que não acontecia havia quatro anos. Neste ano, a frutificação do Rimu estava excelente.
Por que isso importa
A linha do tempo montada por Willison sugere que a mudança mais relevante de 2026 não veio de um salto isolado de capacidade, e sim do acúmulo: dois modelos lançados em novembro de 2025, meses de experimentação nas férias de dezembro e um efeito prático sentido no começo do ano.
A consequência direta é que a confiabilidade dos agentes de codificação deixou de ser promessa e virou rotina de trabalho para parte dos desenvolvedores. Isso muda o cálculo de quem decide quantos projetos assumir.
Ao mesmo tempo, a segurança de agentes aparece como a fronteira ainda em aberto: a comunidade investe esforço nisso, mas o cenário de dano econômico real provocado por agentes sequestrados, previsto de forma dramática, não se materializou até aqui. Willison encerra a palestra justamente nesse tom de aposta em aberto.
Resta saber, quando o ano terminar, se a estratégia de assumir mais projetos do que nunca terá se provado acertada.
Fontes e links
- Simon Willison
- Gravação da palestra no WeAreDevelopers World Congress North America
- Grade de sessões da conferência
- Oxide and Friends: LLM predictions for 2026







