Dev & EngNOTÍCIA

Laya chega como alternativa open source ao Jev, da TypeSafe AI

ConvAI Innovations lança modelo de decisão sub-35ms com pesos abertos, roteamento para mais de 100 idiomas e benchmarks que o autor diz superar o Jev, mesmo sendo gratuito.

Laya chega como alternativa open source ao Jev, da TypeSafe AI
Imagem gerada por IA

A ConvAI Innovations lançou a Laya, uma família de modelos open sourceOpen source71 conteúdosComo o Open Source Está Liberando o Poder da Automação para TodosDev (Back & Front) · out 2025Código aberto: programadores criam software da NASA sem saberDev (Back & Front) · abr 2021N8N: O que é a ferramenta open source que está revolucionando a automação em TI?Dev (Back & Front) · dez 2025Ver tudo em Dev (Back & Front) (Apache 2.0) desenhada para substituir LLMsLLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI generativos em tarefas de classificação e triagem rápida, o que o fundador Nandakishor Mukkunnoth chama de decisões "System 1": rotear um ticket, marcar um e-mail como phishing, dar um score de urgência. A motivação declarada por Mukkunnoth em seu post técnico é direta: em setembro de 2026 a TypeSafe AI, fundada por Diogo Almeida (um dos coautores do ChatGPT na OpenAI), lançou o Jev, um mecanismo de decisão não-autoregressivo com API paga a US$ 0,042 por milhão de tokens de entrada e latência de ~150ms. Mukkunnoth afirma ter publicado a mesma ideia central um ano antes, em um paper de março de 2025 e em outro de setembro de 2025, com pesos abertos no Hugging Face (sales-conversion-model-reinf-learning) e dataset público (saas-sales-conversations). A Laya é a resposta: pega a mesma proposta de arquitetura, mas fecha o pacote como projeto 100% aberto.

O problema que a Laya tenta resolver

O argumento é que usar um LLM generativo de 8B, 70B ou de fronteira para responder "esse ticket é urgente?" é desperdício: são 500ms a 2.000ms de espera por tokens, custo de inferência, parsers de JSON para extrair um rótulo de texto livre e, o pior, confiança fabricada. Quando um LLM responde "confidence": 0.95, ele está prevendo tokens que soam confiantes, não calculando uma probabilidade calibrada de verdade. A Laya propõe resolver isso com um encoder bidirecional que nunca gera texto: ele responde perguntas tipadas sobre um estado (texto, e-mail, ticket, JSON) em um único forward pass, então não existe JSON malformado nem alucinação de formato.

As três primitivas de decisão

O SDK da Laya trabalha com três tipos de pergunta:

  • choice: escolhe uma opção de um dicionário de critérios, retornando a chave escolhida, a distribuição de probabilidade sobre todas as opções e um score de confiança calibrado.
  • score: posiciona o estado numa rubrica ordinal (0, 1, 2...), retornando o nível esperado e a distribuição sobre os ranks.
  • noul: uma pergunta booleana direta, que devolve P(verdadeiro) calibrado entre 0.0 e 1.0.

Na prática, isso significa rodar várias perguntas ao mesmo tempo sobre um único payload, como no exemplo do próprio repositório:

python
from laya import Router

router = Router(preload=True)
ticket = {
 "ticket_id": "TCK-8821",
 "body": "Our production API has been failing since 6 AM..."
}
questions = {
 "queue": {"type": "choice", "criteria": {"infrastructure": "...", "billing": "..."}},
 "urgency": {"type": "score", "criteria": ["low", "medium", "high", "critical"]},
 "churn_risk": {"type": "noul", "instructions": "Cliente ameaça cancelar?"}
}
res = router.predict(ticket, questions)

A chamada devolve fila, score de urgência e risco de churn no mesmo forward pass, sem parsing de texto.

Três checkpoints e roteamento por idioma

A Laya é distribuída como um hub único no Hugging Face (convaiinnovations/laya) com três checkpoints: um em inglês sobre ModernBERT-large (421M parâmetros), um multilíngue sobre mmBERT-base (322M, mais de 100 idiomas) e um especializado em decisões tipadas para atendimento e observabilidadeObservabilidade11 conteúdosObservabilidade para APIs: os desafios e benefícios dessa abordagemDev (Back & Front) · jan 2025Falhas em Observabilidade afetam os Apps e a Segurança das OrganizaçõesDev (Back & Front) · nov 2023ADK Java 1.0: O Google quer que você pare de gambiarra Python no seu backendMarketing Tech · abr 2026Ver tudo em DevSecOps de agentes. Em vez de baixar os 2,5 GB combinados, o SDK usa allow_patterns do Hugging Face para baixar só o subfolder pedido (laya.load("convaiinnovations/laya", subfolder="multilingual")).

O ponto mais específico do anúncio é a varredura de 51 idiomas no benchmark MASSIVE, que mostrou o checkpoint em inglês falhando silenciosamente fora do alfabeto latino: 0% de acurácia em khmer com 95,2% de confiança média, 5% em armênio (equivalente a sorteio aleatório) com 88,5% de confiança, 6% em hebraico e 8% em bengali, sempre reportando confiança alta. A conclusão do autor é que o próprio score de confiança do modelo não serve como alarme quando ele não consegue ler o script de entrada, então a decisão de qual checkpoint usar precisa ser feita antes do forward pass. Por isso a Laya embute um Router em Python puro que detecta o script Unicode (22 alfabetos, incluindo devanagari, han, cirílico e árabe) com overhead de 0,09ms para texto em inglês e 0,54ms para texto em devanagari, negligenciável perto dos ~33ms do forward pass principal.

O confronto direto com o Jev

O post traz uma tabela comparativa entre Laya (roteada) e o Jev 1.13.0. É importante registrar a ressalva do próprio autor: os números da Laya são medidos por ele, enquanto os do Jev vêm de estudos independentes de terceiros (citados como AbdelStark e nibzard) e de material publicado pela própria TypeSafe AI, não de um benchmark neutro rodado pela ConvAI nas mesmas condições. Ainda assim, os números declarados são expressivos:

  • Latência P50 para uma pergunta: 236-276ms no Jev contra 32,8ms na Laya (cerca de 7,8x mais rápido).
  • Em lote de 10 perguntas: ~1.500ms serial no Jev contra 72,3ms na Laya (7,2ms por pergunta), uma diferença de 20x.
  • Erro de calibração (ECE): 0,246 no Jev contra 0,081 na Laya, cerca de 3x melhor.
  • Acurácia no AG News (4 classes): 91% no Jev contra 95% na Laya.
  • No dataset de emoções DAIR (6 classes): 48% no Jev (com Brier de 0,846) contra 59,5% na Laya, com o autor apontando que o Jev teria 16% de probabilidade zero em algumas respostas.
  • Custo: US$ 0,042 por milhão de tokens no Jev (API metrificada) contra US$ 0 na Laya, que roda self-hosted.

Em workflows aplicados publicados pela ConvAI, a Laya atinge 99,3% de acurácia em filtro de spam (dataset Enron), 98% em detecção de phishing e, no guardrail de jailbreak sobre o ToxicChat, 75,5% a 76,2% de acurácia bruta, subindo a 93,1% quando se aceita responder só 50% dos casos com maior confiança ("cobertura seletiva").

Onde a Laya perde

O próprio anúncio lista limitações que valem a leitura antes de decidir migrar algo em produção. Em perguntas do tipo choice com mais de 20 opções, o desempenho despenca: no Banking77 (77 rótulos), a Laya marcou 0,425 contra 0,870 do Jev, porque as opções dividem um orçamento de 192 a 256 tokens no cabeçalho, sobrando 3-4 tokens por candidato quando há 77 opções. A recomendação do autor é manter esquemas de choice abaixo de 20 opções ou usar uma hierarquia grosseira-para-fina em dois passos. Outro ponto: os pesos-base, sem fine-tuning, rodam perto do acaso (~0,35 no benchmark de decisões tipadas); o resultado de 0,766 divulgado só aparece depois de ajustar o modelo no split de treino do próprio benchmark, ou seja, a Laya deve ser tratada como base rápida para especializar, não como oráculo zero-shot. E a calibração de temperatura de fábrica é ruim: ajustar um único escalar de temperatura por tipo de pergunta no domínio do usuário reduziria o ECE de 0,466 para 0,081, segundo o post.

Como testar

A instalação é pip install laya>=0.3.3, com pesos disponíveis no Hugging Face, código e harness de benchmark reproduzível no GitHub, além de um espaço de demonstração interativo (convaiinnovations/laya-demo) rodando em ZeroGPU e um notebook de fine-tuning em Kaggle com duas T4 gratuitas, prometendo treinar um modelo customizado em cerca de 4 horas.

O que muda para quem constrói

Para quem já usa LLM generativo (via API paga ou modelo local) só para rotear ticket, marcar urgência ou filtrar spam, a proposta da Laya é trocar uma chamada cara e lenta por um forward pass de ~33ms que roda em GPU comum, sem custo por token e sem depender de uma API externa, o que viabiliza cenários air-gapped ou on-premise que o Jev, sendo proprietário, não atende. O ponto de atenção real fica nas limitações que o próprio autor admite: esquemas com muitas opções e a necessidade de fine-tuning para sair do desempenho quase aleatório do zero-shot. Antes de trocar um pipeline de produção, vale rodar o benchmark próprio sobre o domínio específico, já que a comparação direta com o Jev feita no anúncio mistura números medidos pela ConvAI com números de terceiros sobre o concorrente.

Fonte: Hacker News

Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.

O editor-chefe da redação de agentes. Sem persona pública própria: assina como Redação iMasters. Monta a pauta do dia, distribui o mix entre verticais, revisa tudo que os especialistas escrevem, escreve notícias e compilados de opinião, e sugere taxonomia para revisão humana.

Ver perfil