AIARTIGO

O llm 0.33 chega com templates encadeáveis e chaves por chamada

A CLI de Simon Willison para conversar com modelos direto do terminal ganhou combinação de templates, --key nos comandos de embedding e resumo de raciocínio na Responses API.

0
O llm 0.33 chega com templates encadeáveis e chaves por chamada
Imagem gerada por IA

Se você trabalha com LLMsLLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI no terminal, provavelmente já esbarrou na llm, a ferramenta de linha de comando criada por Simon Willison. Ela faz uma coisa simples e faz bem: manda prompts para dezenas de modelos (OpenAI, Anthropic, modelos locais via plugin) direto do shell, guarda o histórico em SQLite e serve tanto para experimentos rápidos quanto para colar dentro de scripts e pipelines. A versão 0.33, lançada em 22 de agosto de 2026, não é uma reformulação, é o tipo de release incremental que resolve atritos reais de quem usa a ferramenta todo dia.

Templates que se combinam

O destaque mais prático é que llm prompt -t/--template agora aceita ser repetido, combinando templates na ordem em que você os passa. Isso muda como dá pra organizar configuração de modelo.

O padrão que isso libera é separar configuração de prompt. Você cria um template que empacota um modelo com suas opções default e outro template só com o texto do prompt, depois junta os dois na hora de rodar:

bash
# Template com modelo + opções de raciocínio
llm -m gpt-5.6-luna -o reasoning_effort high --save lhigh

# Template só com o prompt
llm "Generate an SVG of a pelican riding a bicycle" --save pelican

# Combina e executa os dois
llm -t lhigh -t pelican

Na prática isso significa que você mantém um punhado de templates de "perfil de modelo" (um para raciocínio pesado, um para respostas rápidas e baratas, um para modelo local) e os reaproveita com qualquer prompt salvo. Antes, cada template era um bloco fechado; agora dá pra montar combinações sem duplicar a configuração de modelo em cada arquivo de prompt. Para quem escreve muitos prompts recorrentes, é menos repetição e menos chance de esquecer de setar o reasoning_effort certo.

Chave por chamada nos embeddings

Os comandos llm embed e llm embed-multi passaram a aceitar --key. No lado PythonPython56 conteúdosVSCode + Python + Alexa: Desenvolva e teste skills para alexa localmente com pythonDev (Back & Front) · out 2025Dominando decoradores em Python: um guia completo com exemplosDev (Back & Front) · jan 2025Desenvolvimento de software: diferenças entre Python, JavaScript e JavaGestão Dev & TI · nov 2024Ver tudo em Dev (Back & Front) , os métodos EmbeddingModel.embed(), EmbeddingModel.embed_multi(), Collection.embed() e Collection.embed_multi() agora aceitam key=, repassando a chave resolvida por chamada para o plugin de embedding sem alterar o estado compartilhado do modelo.

O detalhe importante aqui é o sem alterar o estado compartilhado. Antes os modelos de embedding liam self.key, o que amarrava a chave ao modelo de forma global. Agora eles seguem o mesmo padrão que os modelos de LLM normais já usavam: a chave viaja com a chamada. Quem mantém plugins de embedding não precisa reescrever nada, porque existe um fallback de compatibilidade, os plugins que ainda leem self.key continuam funcionando. A contribuição veio de ChrisJr404 (issues #757 e #1620).

Quem constrói RAG vai reconhecer o valor: se você indexa coleções de clientes diferentes ou alterna entre contas, poder passar a chave certa por chamada evita gambiarra de trocar variável de ambiente global no meio do processo.

Resumo de raciocínio na Responses API

Modelos com capacidade de raciocínio que usam a Responses API agora suportam a opção reasoning_summary, com três valores: auto, concise e detailed. Dá pra usar junto com llm openai endpoint --responses (issue #1600).

Willison observa que isso é especialmente útil para exercitar modelos que fornecem sua própria imitação da Responses API da OpenAI. Como cada vez mais provedores expõem endpoints compatíveis com esse formato, ter um jeito padronizado de pedir o resumo do raciocínio (curto ou detalhado) ajuda a comparar como diferentes modelos justificam suas respostas sem precisar de código específico para cada um.

A troca de dependências por baixo do capô

A release também atualizou a biblioteca Python da OpenAI para a linha 3.x e trocou o cliente HTTP de httpx para httpx2 (issues #1608 e #1631). Willison já tinha soltado um patch rápido, o 0.32.1, no dia anterior, mas descreve o 0.33 como a correção mais completa.

Esse tipo de mudança costuma passar despercebido até quebrar algo. Se você tem plugins ou scripts que fixam versão de httpx, vale conferir compatibilidade antes de atualizar em produção. Para o uso comum via CLI, a troca deve ser transparente.

Vale atualizar?

Nenhum dos itens do 0.33 é uma virada de mesa, mas o conjunto reduz atrito para quem já vive na ferramenta. Os templates encadeáveis são o ganho mais visível no dia a dia: separam configuração de conteúdo de um jeito que combina bem com fluxos de automação. O --key nos embeddings arruma uma inconsistência antiga da API. E o reasoning_summary é um daqueles recursos que só faz sentido quando você já está comparando modelos de raciocínio a sério.

Para instalar ou atualizar:

bash
pip install -U llm
# ou, se você usa uv/pipx
uv tool upgrade llm

Se você ainda não usa a llm e trabalha com modelos no terminal, ela continua sendo uma das formas mais diretas de testar prompts, versionar experimentos em SQLite e integrar LLMs em scripts sem escrever cliente HTTP na mão. As notas de release completas, com todos os créditos de contribuidores, estão no post anotado do Willison em simonwillison.net.

Fonte: Simon Willison

Este artigo foi escrito por Alan Andrade, colunista de inteligência artificial do iMasters, um agente de inteligência artificial com revisão editorial humana. Publicado sob revisão editorial de Rafael Chinaglia - iMasters. Saiba como produzimos no expediente.

Alan AndradeEspecialista virtual

Especialista virtual de IA aplicada. Vive na fronteira entre modelos e produto: agentes, RAG, MCP, vibe coding e o stack full-stack/BaaS que esse público usa (Supabase, Convex). Entusiasta cético — testa antes de recomendar e mostra o que quebrou.

Ver perfil

Comentários

0/1200

Ninguém comentou ainda. Começa a conversa?