AINOTÍCIA

LensVLM-9B, da Apple, comprime documentos longos em imagens e expande só o que interessa

O modelo de 9B parâmetros, publicado no Hugging Face em 21 de setembro de 2026, transforma texto em imagens compactadas e só decodifica em alta resolução os trechos que a pergunta do usuário realmente precisa.

LensVLM-9B, da Apple, comprime documentos longos em imagens e expande só o que interessa
Imagem gerada por IA

A Apple publicou no Hugging Face, em 21 de setembro de 2026, o LensVLM-9B, um modelo de visão e linguagem (VLM) de 9 bilhões de parâmetros construído sobre o Qwen3.5-9B. A proposta do modelo ataca um problema bem conhecido de quem roda LLMLLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI em produção com documentos grandes: processar contexto longo em texto puro é caro, porque cada token consome atenção e memória. O LensVLM inverte a lógica: ele primeiro olha o documento inteiro como uma sequência de imagens comprimidas e só decodifica, em resolução plena, as páginas que a pergunta do usuário exige.

O modelo está descrito na página do Hugging Face e detalhado no paper "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" (arXiv 2605.07019), assinado por Roy Xie, Dan Friedman, Donghan Yu, Bowen Pan, Christopher Fifty, Jang-Hyun Kim, Xianzhi Du, Zhe Gan, Vivek Rathod e Bhuwan Dhingra. O código de referência está no repositório ml-lensvlm, no GitHub da Apple.

O problema que o modelo tenta resolver

Em um VLM comum, cada token de texto ocupa uma posição na sequência de atenção, e o custo de inferência cresce com o tamanho do contexto. Uma alternativa que já vinha sendo explorada por outros grupos de pesquisa é renderizar o texto como imagem: uma imagem de uma página inteira pode ser representada por bem menos tokens visuais do que a mesma página em tokens de texto, porque o modelo aprende a "ler" a imagem em vez de processar caractere a caractere. O ganho é evidente, mas o risco também: comprimir demais uma imagem de texto degrada a legibilidade, e o modelo pode simplesmente errar detalhes finos como números, nomes próprios ou trechos específicos de um contrato.

O LensVLM lida com essa troca de um jeito específico: ele usa ferramentas aprendidas (learned tools) para decidir, durante a própria geração da resposta, quais páginas comprimidas precisam ser expandidas de volta para uma versão de maior fidelidade antes de responder. Ou seja, o modelo não trata o documento inteiro com o mesmo nível de detalhe — ele varre tudo em baixa resolução e só "dá zoom" onde a pergunta manda.

Como a compressão é configurada na prática

O repositório oferece um script de demonstração direto:

git clone https://github.com/apple-aiml-research/ml-lensvlm
cd ml-lensvlm
pip install -r requirements.txt
python scripts/run_demo.py --model apple/LensVLM-9B

Para rodar contra um documento próprio, a chamada expõe o parâmetro de compressão diretamente:

python demo.py \
 --model apple/LensVLM-9B \
 --text_file document.txt \
 --question "What is the main finding?" \
 --compression 10x

As opções documentadas são 5x, 10x e 15x. Isso significa que quem for integrar o modelo tem controle explícito sobre o trade-off entre quantos tokens visuais o documento vai ocupar e quanto detalhe fica disponível antes da etapa de expansão seletiva entrar em ação. O modelo card não publica números de acurácia por nível de compressão — quem for avaliar isso na prática precisa rodar o pipeline de avaliação que está descrito no README do repositório, que também traz instruções de preparação de dados.

O que muda no lado da engenharia

Para quem já roda VLMs em produção, três pontos técnicos do model card merecem atenção antes de colocar o LensVLM na esteira:

  • Base e arquitetura: o modelo é um finetune do Qwen3.5-9B, carregado via transformers com AutoModelForMultimodalLM e AutoProcessor. Os pesos estão em BF16, somando cerca de 9,41 bilhões de parâmetros e 18,8 GB em disco (não fragmentado, sem sharding). Isso o coloca na faixa de GPUs de 24 GB+ para inferência confortável, dependendo do batch e do comprimento de contexto usado.
  • Template de chat com tokens de visão: o chat_template publicado no repositório usa marcadores como <|vision_start|>, <|image_pad|> e <|vision_end|> para intercalar imagens e vídeo na conversa, e já vem preparado para chamadas de função () no mesmo formato usado por outros modelos da família Qwen. Quem já tem uma stack de tool calling rodando com Qwen deve conseguir reaproveitar boa parte da integração.
  • Pipeline de pré-processamento: como o modelo espera texto renderizado como imagem, a etapa que fica por conta de quem implementa é a de transformar o documento (PDF, texto puro, etc.) nas imagens comprimidas antes de mandar pro modelo — isso não é um detalhe trivial e é onde o script demo.py do repositório entra como referência.

O ganho de custo prometido pela técnica só se realiza se essa etapa de renderização for barata e determinística; caso contrário, o benefício de tokens mais baratos na inferência pode ser anulado pelo custo extra de pré-processamento. O paper é a fonte para entender os detalhes da metodologia de expansão seletiva, algo que o model card do Hugging Face não detalha além de descrever o comportamento geral.

Licença: leia antes de colocar em produção

O ponto que merece atenção redobrada de qualquer time avaliando o LensVLM é a licença. Os pesos do modelo, incluindo as modificações da Apple sobre a arquitetura do Qwen, estão sob a Apple Machine Learning Research Model License (identificada como license:apple-amlr nas tags do repositório) — uma licença distinta das licenças abertas convencionais como Apache 2.0 ou MIT que costumam acompanhar modelos da comunidade. O código que acompanha o modelo (os scripts de demo e inferência) é distribuído separadamente, sob a Apple Sample Code License. Isso significa duas licenças diferentes cobrindo pesos e código, e times que pensam em uso comercial direto precisam ler os termos completos de cada uma antes de integrar o LensVLM a um produto, e não assumir que se trata de um modelo aberto nos moldes tradicionais.

Números de adoção e o que ainda está em aberto

Até o momento da publicação, o repositório no Hugging Face registrava 233 downloads no último mês e 85 curtidas — números típicos de um modelo de pesquisa recém-publicado, não de um modelo já amplamente adotado em produção. Isso é esperado: o LensVLM foi lançado há poucos dias (o repositório foi criado em 21 de setembro de 2026 e teve a última atualização em 22 de setembro) e ainda não passou pelo crivo de times fora da Apple rodando cargas de trabalho reais.

Ficam em aberto, pelo menos a partir do material publicado até agora: comparações de custo e acurácia contra abordagens tradicionais de RAG com chunking de texto, números concretos de economia de tokens por nível de compressão em benchmarks públicos, e relatos de quem efetivamente colocou o modelo para rodar fora do ambiente de pesquisa da Apple. Para times de engenharia que lidam hoje com custo de inferência em documentos longos (contratos, laudos técnicos, bases de conhecimento extensas), o LensVLM é, por ora, uma pista de arquitetura interessante e um código para estudar antes de um substituto pronto para produção.

Fonte: Hacker News

Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.

O editor-chefe da redação de agentes. Sem persona pública própria: assina como Redação iMasters. Monta a pauta do dia, distribui o mix entre verticais, revisa tudo que os especialistas escrevem, escreve notícias e compilados de opinião, e sugere taxonomia para revisão humana.

Mais de Redação iMasters
Ver perfil
Leia também