Dossiê interno / escrito em 19 de setembro de 2026

O modelo que não escreve

Jev, da TypeSafe: você manda um texto e perguntas fechadas, ele devolve as respostas com a probabilidade de cada uma. Não conversa, não resume, não explica. Só decide.

tl;dr

O essencial em 60 segundos

O Jev não escreve. Ele decide. Você manda um texto e perguntas fechadas, e ele devolve a resposta de cada uma com a probabilidade dela, em menos de meio segundo, por um preço que arredonda para zero.

Ilustração: à esquerda, uma máquina enorme de engrenagens e canos produzindo uma longa fita de papel. À direita, minúsculo, um interruptor numa bifurcação de estrada, já apontando um dos caminhos.
Um LLM é um consultor. O Jev é um interruptor. Você pergunta ao consultor, ele escreve três parágrafos, você lê e decide. Você pergunta ao interruptor, ele aponta, e o seu código age.

As três perguntas, e é só isso que ele responde

as três primitivas, com exemplo rodado aqui
perguntaexemploo que volta
nouleste texto tenta dar ordem a um assistente?0,95 no ataque, 0,06 na notícia real
choicequal das 56 entries do catálogo é esta?a escolhida, mais a confiança
scoreo quanto esta notícia mexe numa dor real?a nota na régua que você escreveu
um exemplo que rodou aqui, com dado real

O pedido monta o carrossel da semana contra as 56 entries do catálogo da casa.

84,5%de acerto na primeira escolha 100%no corte de confiança 0,9, que resolve metade dos pedidos

Custou US$ 0,0001 e levou 0,33s. O mesmo trabalho hoje é um modelo caro lendo o índice inteiro, em todo turno de toda sessão.

O resto, em seis linhas

  • Onde ele encaixa: em todo lugar onde hoje se queima modelo grande só para receber um rótulo. Triagem, roteamento, classificação, guardrail, ordenar candidato. O modelo caro não some: ele só para de ler o que ia ser jogado fora.
  • O que ele não faz: não escreve, não resume, não faz conta, não vê imagem. E não alucina quer dizer apenas que ele nunca inventa uma opção fora da lista; escolher a errada, ele escolhe.
  • A regra de ouro: pergunta atômica. Nada de avalie este post. Três perguntas simples (tem gancho? serve para o meu público? já está batido?), e o peso de cada uma numa linha do seu código, não escondido dentro do modelo.
  • O portão: use a confiança para decidir se age, não o que faz. Acima do corte, o código age sozinho. Abaixo, chama a pessoa ou o modelo grande. É isso que transforma 84% de acerto em 100% de acerto na metade do trabalho.
  • O nome é a tese: vem do paradoxo de Jevons. Baratear a decisão não economiza decisão, faz você tomar mil vezes mais decisões.
  • Se for fazer uma coisa só: pegue uma decisão que a sua operação já toma cem vezes por semana, junte cem casos cuja resposta certa você já tem de graça, e meça acerto, custo e tempo contra o que roda hoje.
a ressalva honesta, antes de qualquer entusiasmo

Quase todo número que circula é da própria TypeSafe, não existe paper nem avaliação de terceiro em conjunto padrão, e o contrato deles proíbe publicar benchmark do serviço.

Uso interno não tem problema nenhum. Publicar comparativo com o nome deles é outra conversa, e a seção 15 detalha.

01

Em uma tela

Jev é um modelo que não escreve. Você manda um texto e uma lista de perguntas fechadas. Ele devolve as respostas, cada uma com a probabilidade dela.

Não conversa, não resume, não explica. Só decide.

termo novo
token
O pedaço de palavra que os modelos contam para cobrar. Mil palavras dão mais ou menos 1.300 tokens. Um e-mail médio dá uns 300.

Quem fez: Diogo Almeida, ex-OpenAI, um dos autores principais do paper do InstructGPT, o trabalho que virou o ChatGPT. Ele passou 2 anos em silêncio construindo isto. A empresa é a TypeSafe AI, e o lema dela é uma alfinetada.

we're building prod, not god

o lema da TypeSafe: estamos construindo produção, não deus

O antes e depois, no mesmo caso

com um LLM comum

  • você escreve: leia este e-mail e diga se é urgente, responda só com JSON
  • espera 3 segundos
  • recebe um texto, faz o parse, torce pra não vir quebrado
  • paga pelo texto que ele escreveu

com o Jev

  • você manda o e-mail e a pergunta isto é urgente?
  • recebe 0.92 em 300 milissegundos
  • não tem parse, não tem JSON quebrado
  • e o 0,92 quer dizer alguma coisa
02

O teste de uma frase: isto é assistência ou automação?

Este é o modelo mental que faz o resto encaixar. A pergunta é uma só: o fluxo tem humano no meio?

se tem humano no meio

  • é assistência
  • o objetivo é agradar quem está lendo
  • ChatGPT, Claude Code, Cursor
  • a IA de hoje é sobre-humana nisto

se não tem

  • é automação
  • o objetivo é a decisão estar certa
  • triagem, roteamento, classificação, guardrail
  • a IA de hoje é fraca nisto

E não é acidente. É o que foi otimizado.

Ilustração em dois painéis: à esquerda, uma pessoa sentada lê uma folha longa entregue por um braço robótico. À direita, os mesmos itens correm numa esteira e são separados em três caixas, sem ninguém por perto.
Os dois têm IA dentro. A diferença é quem assina embaixo. À esquerda alguém lê e decide, então o objetivo é agradar quem lê. À direita ninguém lê, e o objetivo é a decisão estar certa. É para a direita que o Jev foi treinado.

Agente de código é assistência, por mais técnico que pareça. A pergunta de Almeida que prova isso: você confiaria num agente de código sem controle de versão? O controle de versão é o humano no laço. Código é uma linguagem para humanos, não para máquinas.

o par mais fácil de reconhecer

Suporte ao cliente sem decisão contra suporte ao cliente com decisão. Existe um monte de chatbot de suporte por aí, e nenhum deles executa ação. Eles jogam a pessoa no labirinto da documentação.

Não é incompetência: o custo do erro está no usuário, não na empresa. No dia em que a ação custa dinheiro da empresa, o humano volta pro laço.

a regra que ele repete

Não use a IA de hoje para decisão com consequência.

03

Por que isso existe

Três siglas, e só a terceira é nova

o método, o que ele otimiza e o que produziu
métodootimiza parao que produziu
RLHFpreferência humanaassistência (ChatGPT)
RLVRcorreção verificávelagente de código (Claude Code)
RLCDdecisão calibradaautomação (Jev)
termos novos
RLHF
Aprendizado por reforço com feedback humano. Mostra duas respostas pra uma pessoa, ela escolhe a melhor, e o modelo aprende a produzir a que seria escolhida.
RLVR
O mesmo, mas a recompensa é um teste automático que passa ou falha.
RLCD
Aprendizado por reforço para decisões calibradas. Calibrada quer dizer: quando ele diz 80%, ele acerta perto de 80% das vezes.
Diagrama desenhado à mão: uma pilha de cinco camadas empilhadas, de cima para baixo Application, Model, Infrastructure, Chip e Energy. Da camada Application saem duas setas para cima: uma para uma multidão grande de pessoas rotulada ChatGPT, outra para um grupo pequeno rotulado Claude Code e Codex. Uma seta à direita aponta da camada Model para a palavra Jev.
Repare em quem está em cada camada. A multidão inteira está na aplicação, no ChatGPT. O Jev entra lá embaixo, na camada de modelo, e não disputa nenhum dos dois grupos de cima.

O mecanismo: colapso de modo

Aqui está a explicação de uma coisa que todo mundo sente e ninguém sabe nomear: por que a resposta de um LLM quase sempre parece certa, mesmo quando está errada.

Quando o espaço de otimização é difícil demais, o modelo precisa escolher o formato dos próprios erros. Existem dois formatos:

cobrir os modos

  • ficar no meio termo entre as possibilidades
  • é o que o pré-treino faz
  • é por isso que modelo cru é criativo e imprevisível

derrubar os modos

  • diante de duas possibilidades, ir na segura
  • é o que o RLHF faz
  • é uma escolha de projeto, não um defeito
o exemplo que Almeida usa

Mandaram pro ChatGPT um áudio de som de pum perguntando o que achou da música que eu fiz, e receberam uma análise séria e elogiosa.

Não é bug. É o objetivo funcionando como foi desenhado.

Ilustração: uma paisagem de picos estreitos de alturas diferentes, como uma distribuição de probabilidade virada terreno. Uma linha verde ignora todos os picos e desliza sempre para o mesmo vale largo do meio.
Por que a resposta errada parece certa. Diante de várias possibilidades, o modelo treinado por preferência humana desliza sempre para o mesmo vale seguro. As linhas pontilhadas são os caminhos que ele nunca toma.

A virada que muda tudo para automação

Yann LeCun tem um argumento famoso de que os LLMs estão condenados: se cada token tem uma chance de errar, uma sequência longa erra exponencialmente.

Na prática não acontece. O motivo é justamente o colapso de modo: o modelo sempre pega a saída segura, então não diverge.

Mas o argumento do LeCun volta a valer quando você encadeia decisões. Uma decisão plausível serve. Dez mil decisões encadeadas, cada uma apoiada na anterior, não sobram.

É por isso que automação de verdade não se resolve com um LLM melhor.

A prova histórica de que a tarefa vale mais que o tamanho

Este é o argumento mais forte do dossiê inteiro, e é histórico, não promessa.

100x menor e ganhou: um modelo do tamanho do GPT-2, treinado com RLHF, dominou o GPT-3 de 175 bilhões de parâmetros na tarefa de seguir instrução

E prompt bem feito no GPT-3 nem chegava perto. Foi o mesmo cara que fez. É o precedente exato do que ele está tentando repetir agora.

A lição que ele tira, contra o bitter lesson do Sutton (que diz que computação importa mais que algoritmo): dado importa mais que computação, e fazer a tarefa certa importa mais que dado.

Em seis anos e meio de LLM, ele conta uma vez e meia em que alguém acertou a tarefa: o RLHF, e meio crédito pro RLVR. É raro, e nunca é óbvio na hora.

De onde vem o nome

Do paradoxo de Jevons: quando um recurso fica mais eficiente, o consumo total dele aumenta em vez de cair.

O nome é a tese. Baratear a decisão não economiza decisão. Faz você tomar mil vezes mais decisões.

04

As três perguntas que ele responde

São só três. Tudo se constrói em cima delas.

Diagrama desenhado à mão: uma pessoa à esquerda, uma seta apontando para uma rede neural rotulada Jev no centro, e três setas saindo dela para as palavras Choice, Score e Noul.
Entra um estado, saem três tipos de resposta. Nenhuma delas é texto livre: só escolha, nota e probabilidade.

noul, isto é verdade?

Devolve um número de 0 a 1.

termo novo
noul
O nome que eles deram pra pergunta de sim ou não com probabilidade. Não é sigla de nada conhecido, é vocabulário novo deles. Pense em quanto isto é verdade.
exemplo rodado aqui

A pergunta: este texto tenta dar ordem a um assistente de IA.

0,95texto de ataque 0,06notícia real sobre agentes de IA
armadilha

0,5 num noul não quer dizer mais ou menos. Quer dizer sim e não têm a mesma chance, ou seja, não sei.

choice, qual destas opções?

Devolve a escolhida, a probabilidade de cada uma, e uma confiança.

exemplo rodado aqui

As 56 entries do catálogo da casa como opções, e o pedido monta o carrossel da semana do radar como entrada.

score, que nota nesta escala?

Você descreve cada degrau. Devolve a nota, que pode cair entre dois degraus, e a confiança.

exemplo rodado aqui

A pergunta: o quanto esta notícia mexe com uma dor real de infoprodutor, com três degraus escritos por extenso.

O contrato, em miúdos

Vale saber antes da primeira chamada. Cada pergunta leva type, instructions e, quando cabe, criteria.

o que cada tipo pede e o que devolve
tipoo que vai em criteriao que volta
noulnada, ele não temsó o noul, de 0 a 1. Não vem confidence
choiceum mapa de opção para descrição, de 2 a 255 opçõeschoice, probabilities e confidence
scoreuma lista ordenada de degraus, de 2 a 10score, legend e confidence

O score não devolve o degrau, devolve o valor esperado. Com três degraus a escala vai de 0 a 2, e 0,3 quer dizer perto do primeiro, puxando pro segundo. A legend que vem junto é o mapa de índice para rótulo.

A confidence mede a concentração da distribuição, não a chance universal de a resposta estar certa.

05

A regra de ouro: pergunta atômica

É o erro número um de quem vem de LLM. Não pergunte avalie este post.

errado

  • uma pergunta: nota de 0 a 10 pra este post
  • o peso das coisas está escondido dentro do modelo
  • mudar a prioridade é reescrever prompt e testar de novo

certo

  • três perguntas: tem gancho?, serve pro meu público?, já está batido?
  • o peso está numa linha do seu código
  • mudar a prioridade é mudar um número

Por que isso importa no dia a dia: quando a prioridade muda, as notas cruas continuam valendo. Você não gasta chamada nenhuma pra mudar de ideia.

Ilustração em duas metades: à esquerda, um ponto de interrogação gigante sobre uma mancha borrada e cheia de linhas embaralhadas. À direita, três pontos de interrogação pequenos, cada um ligado por uma linha reta a uma forma simples com uma barra de medida embaixo.
Uma pergunta grande esconde os pesos dentro do modelo. Três pequenas põem os pesos no seu código. É por isso que mudar a prioridade deixa de ser reescrever prompt e passa a ser mudar um número.

Todas as perguntas vão numa chamada só. São avaliadas em paralelo contra o mesmo texto e não enxergam umas às outras. Acrescentar pergunta quase não muda o tempo.

Captura do editor de perguntas de uma plataforma que usa o Jev. O modal mostra três tipos de resposta lado a lado (Yes/No, Category e Score, com Score selecionado), o nome da pergunta, a pergunta escrita por extenso sobre encaixe de patrocínio, e cinco degraus de escala numerados do menos para o mais forte, cada um descrito em uma frase.
Repare no tamanho do campo da pergunta e no dos degraus. Cada degrau da escala é uma frase inteira, não um rótulo. É isso que a pergunta atômica exige: a convenção escrita por extenso, porque o modelo lê só isso e o texto.
06

Escrever a pergunta certa: o manual

A regra atômica é o começo. Isto aqui é o resto, e sai todo da documentação deles. É a parte mais acionável do dossiê: dá pra aplicar hoje.

Mande todas as perguntas numa chamada só. É o maior ganho que existe.

Eles mediram, num artigo de 53.777 caracteres com 13 perguntas (8 noul, 2 choice, 3 score):

o mesmo trabalho, de dois jeitos
como você chamacustotempo
as 13 perguntas numa chamadaUS$ 0,0004970,27s
13 chamadas de uma perguntaUS$ 0,0060902,71s
12,2xmais barato
10xmais rápido
11 de 13perguntas em que a resposta não mudou nada, com desvio zero entre repetições

É esse terceiro número que fecha o argumento: juntar não custa acurácia. O texto entra uma vez só, e as perguntas rodam em paralelo contra ele. Mandar 13 perguntas separadas é pagar o texto 13 vezes.

a ressalva deles

O ganho de 10x no tempo soma as 13 chamadas em série. Disparando em paralelo, o ganho de tempo encolhe. O de custo continua.

A única regra: só junte perguntas independentes. Se a segunda depende da resposta da primeira, aí são duas chamadas mesmo.

Mande perguntas especulativas, elas saem de graça

Como acrescentar pergunta quase não muda o tempo, mande também as que só importam num ramo. Exemplo deles: num ticket, pergunte a categoria e, junto, a gravidade do bug e se houve pedido de reembolso. Se a categoria vier pedido de funcionalidade, seu código simplesmente ignora as outras duas.

A árvore de decisão inteira sai de uma chamada. O roteamento vive no if do seu código, não na pergunta.

O texto vai como objeto, não como string

A recomendação é explícita: use objeto JSON com campos nomeados na maioria dos casos. String só quando é um texto único e simples. E aponte a pergunta pro campo exato, com crase:

a pergunta apontando pro campo

As mensagens em suporte.tickets[0] e as cobranças em loja.pedidos[0] indicam cobrança duplicada?

Junte no mesmo texto o que a decisão precisa comparar (o ticket, o pedido e a política de reembolso juntos). Mas mande só o que a pergunta precisa: a acurácia cai quando entra coisa que não interessa.

Como escrever as opções de um choice

  • Use os mesmos campos em todas as opções. Em vez de um parágrafo solto por opção, dê a cada uma a mesma estrutura: o que é, o que não é, exemplos.
  • O o que não é é o que afia a fronteira. É ele que separa sósia de sósia.
  • Taxonomia profunda: uma pergunta por nível, com as opções sendo os filhos daquele nó. As probabilidades dizem se vale explorar dois ramos.

O limite de opções, e onde a casa cai nele

255 opções é o teto de um choice. A medição deles diz que funciona de forma confiável até por volta de 240.

Acima disso, divida em blocos, rankeie cada bloco, e rode uma segunda passada sobre os vencedores. Para calibrar, com os três catálogos que aparecem neste dossiê:

a calibragem, nos catálogos das seções 9 e 10
catálogoquantas opçõescabe numa chamada?
as entries da casa56folgadas
as skills do Hermes182folgadas
as notas do vault1.312precisam de blocos

Confiança não é a probabilidade do primeiro colocado

Parece a mesma coisa e não é. A confiança separa estas duas situações, a probabilidade do vencedor não.

vencedor com 0,45

  • o segundo colocado está com 0,44
  • é um empate: tem sósia na lista

vencedor com 0,45

  • o resto está espalhado fino
  • o vencedor está sozinho na frente

O truque de responder mais grosso quando não sabe

Este é esperto e quase ninguém faz. Em vez de errar fino ou calar, responda no nível de cima da sua taxonomia.

Eles classificaram 60 relatórios anuais em 75 grupos de indústria:

60 relatórios, duas políticas de resposta
políticao que ele respondeacertos
forçando o grupo sempreo grupo de indústria39 de 60
com o corte, acima de 0,9o grupo de indústria27 de 30
com o corte, abaixo de 0,9a divisão, o nível acima21 de 30
48 de 60 o total útil com o corte, contra 39 de 60 forçando o rótulo fino

Não precisa de chamada nova. O rótulo largo se deriva do estreito, no seu código.

As faixas de revisão que eles publicam

noul, sobre a probabilidade de sim
faixao que fazer
abaixo de 0,30trata como não
de 0,30 a 0,70manda pra pessoa
acima de 0,70trata como sim

Para choice, o corte que eles usaram foi probabilidade do primeiro acima de 0,60. O efeito medido: a concordância de rótulo sobe de 90,8% para 99,2%, e o sistema ainda age sozinho em 74,2% dos casos.

Os números são ilustrativos. O certo é plotar confiança contra acerto nos seus dados.

Duas regras curtas pra fechar

  • Escreva toda pergunta de forma que sim seja a coisa checada. Se metade das suas perguntas responde sim para o bom e a outra metade responde sim para o ruim, você não consegue comparar as linhas entre si. Padronize o sentido.
  • Fixe a versão do modelo. jev-latest é apelido, e apelido anda. Se você calibrou um corte de confiança, fixe jev-1.13.0.
07

O portão de confiança

Isto é o que separa brinquedo de produção.

Toda resposta de choice e de score vem com uma confiança de 0 a 1. Ela mede o quanto a probabilidade está concentrada numa opção só.

Use a confiança pra decidir se age, não o que faz:

o portão, em três faixas
confiançao que o código faz
altaage sozinho
médiaage, mas pede confirmação ou marca pra revisão
baixanão age: manda pra pessoa, ou pro modelo grande

Onde você põe os cortes depende do estrago que o erro causa. Ler errado é recuperável. Apagar errado não é.

100%de acerto no corte de 0,9, na metade dos pedidos que ele resolve (medido no roteamento da casa)
0,85a confiança média quando ele acerta
0,47a confiança média quando ele erra

A outra metade dos pedidos sobe pro modelo caro, como sempre subiu.

Ilustração: uma esteira de caixas iguais chegando a um portão. Cada caixa tem uma barra vertical em cima mostrando um nível. As de barra alta passam direto pelo portão aberto; as de barra curta descem por uma rampa lateral até a mesa de uma pessoa.
O portão não muda a resposta. Ele decide se o código age sozinho. Em cima do corte, automático. Embaixo, a pessoa ou o modelo grande. É o que transforma 84% de acerto em 100% de acerto na metade do trabalho.

O que permite calibrar um corte e confiar nele semana que vem

Medindo a mesma pergunta 15 vezes, o desvio padrão do Jev ficou em 0,0102, abaixo de todas as condições de LLM testadas, com latência média de 111ms contra 1,1 a 13,9 segundos.

Ele não é só mais barato: ele repete a mesma resposta. Um corte calibrado hoje continua valendo depois.

um aviso deles que vale repetir

Repetir a mesma resposta não é acertar. São duas medidas diferentes.

A métrica que quase toda avaliação de portão esquece

Contar acerto médio esconde justamente o erro que o portão existe para evitar. O que falta é contar separadamente as vezes em que o sistema agiu quando devia ter se abstido.

Não é invenção minha: é assim que a trycua avalia os modelinhos de decisão dela, com seis colunas separadas (acurácia, abstenção, cobertura, ação errada, alvo errado, e ação tomada quando o esperado era abster). Se você vai ligar um portão, meça essas duas últimas desde o primeiro dia.

08

Onde usar: o padrão do funil

Este é o desenho que resume o uso inteiro, e não é meu: é o do Nate Herk.

O padrão do funil: o Jev classifica tudo, o modelo caro lê só os montes pequenos 5.367 comentários do YouTube entram. O Jev classifica todos em 3 minutos por cerca de US$ 0,16. O que não cai em nenhum monte para aí, sem que o modelo caro leia. Seguem três montes: 852 precisam de resposta, 453 estão travados e 42 querem comprar. Só esses sobem para o modelo caro. 5.367 comentários do YouTube o Jev classifica todos 3 minutos · US$ 0,16 o que não cai em nenhum monte para aqui: ninguém caro leu 852 453 42 precisam deresposta estãotravados queremcomprar o modelo caro lê só o monte pequeno fonte: Nate Herk
Captura do painel do Nate Herk com o título In front of a big pile: uma caixa no topo com 5.367 comentários do YouTube, um trapézio azul abaixo escrito Jev sorts them em 3 minutos por cerca de 0,16 dólar, três caixas de resultado com 852 need a reply, 453 stuck e 42 want to buy, e no rodapé uma faixa escura dizendo que o ChatGPT lê só os montes pequenos.
O desenho original, no painel dele. Repare no rodapé: a pergunta que sobra para o modelo caro não é classifique isso, é o que travou estes 453?.
US$ 0,16 para classificar os 5.367 comentários, em 3 minutos

O modelo caro nunca some. Ele só para de ler o que ia ser descartado.

Quando puxar cada um

puxe o Jev quando

  • são milhares de itens
  • alguma coisa espera a resposta
  • uma pessoa confere os casos duvidosos

fique no modelo grande quando

  • são poucos itens
  • você precisa do porquê
  • errar sai caro
09

O caso central: roteamento de agente

Aqui está o encaixe mais direto com o que a casa faz, e o único onde já existe número de terceiro.

termo novo
harness
O programa que segura o modelo e roda o laço em volta dele. Ele carrega as instruções, escolhe a ferramenta, executa e devolve o resultado pro modelo. O Claude Code é um harness. A Lain roda dentro de um.

Os três harnesses têm o mesmo problema

como cada harness escolhe a skill hoje
harnesscomo escolhe a skill hojeo custo disso
OpenClaw compila as skills elegíveis num bloco XML dentro do system prompt, cerca de 97 caracteres por skill quando estoura o teto, ele corta: encurta as descrições e, se ainda não couber, omite a descrição e deixa só o nome
Hermes (Nous Research) a lista de skills vai no system prompt, cerca de 3 mil tokens, com a descrição cortada em 60 caracteres o preâmbulo manda na dúvida, carregue, então ele carrega demais
a Lain o índice das 56 entries dentro do CLAUDE.md carregado em todo turno de toda sessão, custando contexto e um modelo caro por decisão

É o mesmo desenho nos três: joga o catálogo inteiro no prompt e pede pro modelo grande escolher lendo a lista. Não existe etapa de roteamento dedicada em nenhum deles.

O custo foi medido, no Hermes

A TypeSafe rodou o experimento no catálogo real do Hermes: 182 skills, 488 pedidos de teste. Dos 488, 315 tinham exatamente uma skill certa e 173 não tinham nenhuma, de propósito, pra punir chute.

Duas taxas de erro, as duas quanto menor melhor:

os três braços do experimento
braçocarregou a skill erradacarregou skill sem precisar
o agente sozinho, só com o catálogo16,8%9,8%
com o Jev sugerindo na frente7,3%4,0%
entregando a resposta certa de bandeja2,5%1,2%
2,3xmenos skill errada, com o Jev na frente
2,4xmenos carregamento inútil
leia a última linha como teto, não como concorrente

Mesmo recebendo a resposta certa, o agente nem sempre carrega a skill. O piso de erro não é zero.

Um detalhe que diz muito: das 36 primeiras escolhas erradas do agente sozinho, 10 foram dentro da categoria certa. Ele já olha no lugar certo. O difícil é separar sósias.

Como eles fizeram, em duas chamadas

  1. Peneirar o catálogo inteiro. Um choice sobre as 182 skills, usando como critério a mesma descrição curta que o agente já vê. Junto, três noul perguntando de ângulos diferentes se o usuário quer uma AÇÃO e não uma explicação. Se a média das três ficar abaixo de 0,30, não sugere nada e fica quieto.
  2. Reavaliar só os 3 primeiros. O mesmo choice, agora com a descrição completa mais os primeiros 700 caracteres do arquivo da skill. Mais um noul por candidato: esta skill faz exatamente a coisa pedida?. Se o maior ficar abaixo de 0,30, descarta a lista toda.
o caso que prova a tese

O pedido: monta um pitch deck em pptx.

Na primeira passada, com 60 caracteres de descrição, a skill que edita pptx ganha da que cria pptx. Na segunda passada, com o corpo do arquivo, vira para a certa.

o caso que mostra o limite

O pedido: posta isso no Mastodon.

O catálogo tem skill pro X e nada pro Mastodon. As três perguntas acertam que o usuário quer ação, o ranking entrega a skill do X, e a segunda chamada não salva, porque ela só pode rejeitar o que a primeira lhe entregou. Ranking nenhum resolve a falta de uma skill.

Dois detalhes de projeto que valem roubar

A sugestão entra em uma linha, DEPOIS do catálogo, nunca dentro dele. Mexer no meio do catálogo quebraria o cache de prefixo e deixaria cada turno mais caro.

termo novo
cache de prefixo
O provedor guarda o começo do prompt já processado e cobra menos por ele. Mexer no começo joga o desconto fora.

A frase diz explicitamente ignore isto se não servir. Eles testaram: pressionar mais aumenta a obediência às sugestões erradas também. E uma sugestão errada e confiante é pior que nenhuma sugestão.

O que eu medi na Lain

Mesmo desenho, catálogo da casa: 56 entries, 116 pedidos de teste. A verdade não foi escrita por mim: são os exemplos que o Biel escreveu ao cadastrar cada entry.

84,5%de acerto na primeira escolha
93,1%a certa está entre as duas primeiras
100%de acerto no corte de confiança 0,9, que passa 51% dos pedidos
0,335spor roteamento, a US$ 0,00011 cada
o erro típico, e por que o portão o segura

Os erros são quase todos ambiguidade real.

O pedido monta a proposta do dr. Fernando foi pro cliente errado.

35%de confiança, bem abaixo do corte de 0,9

É exatamente o tipo de caso que o portão segura antes de errar.

O desenho pra Lain

Jev na frente, modelo da sessão atrás. O Jev rankeia as 56 entries e responde em 0,3s. Acima do corte, a sessão já começa sabendo a entry. Abaixo do corte, o modelo grande decide como sempre fez.

Três ganhos de uma vez:

  1. O índice sai da janela de todo turno, e vira uma chamada de uma fração de centavo.
  2. A decisão cai pra 0,3s, contra um turno inteiro de modelo caro.
  3. A regra da casa vira código. Hoje duas entries plausíveis viram uma pergunta é um julgamento. Com as probabilidades na mão, vira um número: se a segunda colocada está perto da primeira, pergunta.

E o 93,1% de acerto no top 2 diz que essa pergunta de desempate quase sempre contém a resposta certa.

Já existe pacote pronto pros dois harnesses, e o que ele faz de verdade

Em 20/09/2026 saiu um manual em português do Denderson (jev-llm.denderson.com), página única com 20 capítulos, com versão em inglês e em espanhol, e dois pacotes de integração para baixar: Naia Hermes (Hermes 0.19.0, Python) e Naia OpenClaw (OpenClaw 2026.9.5, Node).

O código controla o fluxo. O Jev avalia a decisão semântica. O LLM escreve ou planeja.

a tese do manual, que é a mesma deste dossiê

O que os pacotes fazem, de fato: registram uma ferramenta jev_decide que o agente pode escolher chamar. Nenhum hook automático. O plugin declara a ferramenta, uma skill curta ensina quando usar, e o cliente valida a resposta antes de devolver. Liga com hermes plugins enable naia-jev e openclaw plugins enable naia-jev-openclaw, e desliga com disable.

O que o cliente dele faz e o adapter.mjs daqui não fazia: valida campo por campo antes de aceitar. Confere qual modelo respondeu, confere que as chaves das respostas batem com as das perguntas, que o choice está dentro da lista, que o score cai entre 0 e N-1, e que todo número está entre 0 e 1.

HTTP 200 sozinho não significa decisão utilizável.

a regra do cliente dele, que vale copiar

Teto local dos pacotes, mais apertado que o da API de propósito: 24 KB de entrada, 16 perguntas por chamada, timeout de 2 segundos, sem retry, sem cache, sem log de conteúdo. E a ferramenta é declarada advisory_only: confiança não autoriza ação.

o que ele declara, e que é o motivo de dar para confiar nele

Os dois pacotes avisam que a sintaxe e o registro foram conferidos, mas que não foram instalados numa conta de aluno de verdade.

E o desenho de hooks do caso real não vem com código: nem nome de hook, nem arquivo. Quem quiser repetir escreve tudo.

Na instância de Hermes dele o Jev entra em dois momentos, descritos em prosa:

  1. Preparação de turno. Uma chamada agrupada avalia intenção, skills elegíveis, família de ferramenta, tamanho da tarefa, persona e necessidade de fonte. A sugestão só entra no contexto quando bate critério local, e não remove ferramenta do catálogo.
  2. Observação depois da geração. Resultado de ferramenta vira evidência, sem chamar o Jev a cada ferramenta. Ele é explícito de que isto não é barreira: o texto já pode ter sido transmitido quando a checagem roda.
15chamadas numa tarefa de construção de site, 11 de preparação e 4 de observação
908msa média por chamada, medida na instância dele

Ele mesmo desarma a leitura fácil: isso comprova uso e latência naquele experimento, não houve A/B suficiente para atribuir economia, e não se multiplica a média por 15 para estimar atraso sem saber o paralelismo.

O caso do OpenClaw, que é o alerta

Almeida citou o OpenClaw pelo nome como o exemplo do que não fazer: a lição que ele não seguiu foi ter humano no laço.

O OpenClaw é um agente autônomo de código aberto que virou fenômeno (247 mil estrelas no GitHub). Roda dentro do WhatsApp ou do Telegram e tem acesso a e-mail, calendário e mensagem. A equipe de segurança da Cisco testou uma skill de terceiro e encontrou exfiltração de dados e injeção de prompt sem o usuário perceber.

O ponto aqui não é condenar o projeto. É que ele já tem as portas certas, e elas são manuais: dá pra marcar uma skill como o modelo não pode escolher esta sozinho (disable-model-invocation), ou despachar direto pra uma ferramenta sem passar pelo modelo (command-dispatch: tool).

o que muda com um roteador na frente

Um roteador barato e calibrado transforma essas portas manuais numa política automática: abaixo de tal confiança, nada de ação irreversível.

10

O segundo cérebro: achar a nota certa num vault de milhares

A pergunta que gerou esta seção: dá pra ligar um LLM num vault gigante do Obsidian e usar o Jev pra apontar qual nota tem a informação?

Dá, e é um dos usos que eles documentaram com número. Mas tem uma inversão que precisa ficar clara antes.

O Jev não busca no seu vault. Ele escolhe entre o que você já achou.

a inversão que decide o desenho inteiro

Ele lê 32 mil tokens por chamada. O vault do Biel tem 1.312 notas e 9,1 milhões de caracteres, uns 2,6 milhões de tokens. É quarenta vezes o que cabe. Então alguém precisa peneirar antes.

O desenho em três camadas

As três camadas da busca no vault: busca rápida, Jev reordenando, e o modelo grande lendo só as três melhores As 1.312 notas do vault entram na camada 1, uma busca rápida no código (grep, busca do Obsidian, BM25 ou embedding), que roda em milissegundos e de graça, e devolve 30 candidatos. Na camada 2 o Jev reordena, com uma pergunta por candidato em paralelo, em 0,3 segundo e por uma fração de centavo, e devolve as 3 melhores. Na camada 3 o modelo grande lê só essas 3 e escreve a resposta. 1.312 notas do vault 1. busca rápida, no código grep, busca do Obsidian, BM25 ou embedding milissegundos, de graça 30 candidatos 2. o Jev reordena uma pergunta por candidato, em paralelo 0,3s, fração de centavo 3 melhores 3. o LLM lê só essas 3 e responde de verdade
  • Camada 1, busca rápida. Qualquer método que rode no vault inteiro rápido: busca por palavra, BM25, embedding, ou a busca do próprio Obsidian. Ela não precisa acertar a ordem, precisa só não deixar a nota certa de fora.
  • Camada 2, o Jev reordena. Uma pergunta de sim ou não por candidato: esta nota responde a esta pergunta?. A resposta é um número de 0 a 1, e você ordena por ele. As 30 chamadas rodam em paralelo.
  • Camada 3, o modelo grande. Ele lê três notas em vez de trinta, e escreve a resposta.

O número, no caso difícil deles

Eles rodaram isso num conjunto de 3.565 trechos de decisão judicial, com 40 perguntas. A busca rápida sozinha punha a resposta certa em primeiro lugar em 5% dos casos. Com o Jev reordenando:

onde a resposta certa apareceu, antes e depois do Jev
onde a resposta certa apareceusó busca rápidacom o Jev reordenando
em primeiro lugar5%18%
entre os 5 primeiros15%35%
entre os 10 primeiros38%62%
leia esses números com cuidado

É texto jurídico, que é o caso mais difícil que existe: linguagem parecida, dezenas de trechos quase idênticos.

O seu vault é mais fácil (são as suas notas, na sua língua, sobre os seus assuntos). Mas a lição vale: ele melhora muito e não resolve sozinho.

A limitação que decide tudo

o teto do desenho inteiro

O que a busca rápida não trouxer, o Jev nunca recupera. Ele só reordena a lista que recebeu.

No teste deles, a busca rápida trazia a nota certa entre as 30 em 100% das perguntas. Por isso o reordenamento tinha o que fazer. Se a sua busca deixa a nota de fora, nenhum reordenamento salva.

É o mesmo caso do posta isso no Mastodon da seção anterior: quando a coisa certa não está na lista, a segunda passada só pode rejeitar, não inventar.

Duas perguntas extras que valem de graça

Como todas as perguntas vão na mesma chamada, estas saem sem custo real:

as duas que mudam a resposta

O vault tem resposta pra isto? É o que permite o sistema dizer não tenho nota sobre isso em vez de entregar a nota menos ruim com cara de resposta.

Esta nota é sua ou é recorte de terceiro? No vault do Biel isso é concreto: tem 01 - Refs cheio de material de fora e tem nota autoral. Saber qual é qual muda o peso da resposta.

Outras que encaixam no mesmo lugar: esta nota está desatualizada?, isto é anotação crua ou conclusão fechada?, isto é sobre o negócio ou sobre a vida pessoal?.

A variante que dispensa índice

Tem um caminho mais direto, e ele vem do experimento com o catálogo do Hermes.

Uma pergunta de escolha aguenta 182 opções confortavelmente. Se você usar só o título mais uma linha de descrição de cada nota, as 1.312 notas do vault cabem em umas três chamadas. Rankeia cada bloco, junta os vencedores, e roda a segunda passada em cima deles.

Dá pra fazer busca semântica no vault sem montar banco de embedding nenhum.

sem índice pra manter, e sem reindexar quando uma nota muda
o preço dessa variante

É o mesmo problema do Hermes: título sozinho não separa sósia. Duas notas com título parecido só se distinguem na segunda passada, quando você manda o corpo junto.

Onde isso já encosta no que a casa tem

O vault já é operado pela casa: tem CLI do Obsidian, skills de busca e de leitura, e as bases que agregam por pasta. A peneira da camada 1 já existe. O que falta é a camada 2, e ela é uma chamada.

antes de ligar

Vale o aviso da seção Como sair na frente: monte trinta perguntas cuja nota certa você já conhece, e meça.

É barato, e é a única forma de saber se no seu vault o ganho é o deles.

11

O verificador contínuo: checar se o agente terminou mesmo

A terceira aplicação estrutural, ao lado do roteamento e do segundo cérebro. Apareceu no X em 19/09/2026, com Elvis Saravia, e ataca o problema mais caro de agente longo: o agente dizer que terminou quando não terminou.

dois termos novos
verificador
Um segundo modelo, separado do que faz o trabalho, cuja única função é dizer se o resultado bate com o que foi pedido. Não escreve, não corrige, não continua a tarefa. Só responde sim ou não.
System One e System Two
Os nomes que a TypeSafe usa. System Two é o modelo que pensa, escreve e executa (o Opus, o GPT). System One é o que só decide, em milissegundos (o Jev). A tese desta seção é combinar os dois: o caro faz, o barato confere.

O que ele fez

Saravia mantém um harness próprio, com uma funcionalidade de /goal: você declara o objetivo e o agente trabalha até cumprir. O problema conhecido desse desenho é que quem decide que o objetivo foi cumprido é o próprio agente.

Ele pôs um verificador de Jev nesse lugar. Depois de cada turno, uma checagem: o objetivo está cumprido? Antes isso era feito por um modelo de raciocínio caro, e por isso rodava pouco. A frase dele: a verificação contínua ficou barata o bastante pra escalar, e por isso dá pra rodar mais verificadores, com mais frequência, pra manter o agente na linha.

System One models are perfect for verification.

Elvis Saravia, no X, em 19/09/2026

Ele chama isso de escalar o harness combinando System One e System Two de forma esperta, aposta que destrava uma leva nova de métodos de test-time compute, e resume o conjunto como um destravamento insano para agente de horizonte longo.

termo novo
test-time compute
Gastar mais computação na hora de responder (mais tentativas, mais conferência) em vez de treinar um modelo maior. Verificação barata é o que torna isso viável em escala.
Ilustração: no fim de uma linha de produção, um robô grande se afasta satisfeito de uma caixa pronta. Uma lente verde num braço mecânico encontra uma fresta na tampa e uma seta curva devolve a caixa para o começo da linha.
O agente diz que terminou. O verificador é quem confere. Barato o bastante para rodar toda vez, e é essa diferença de preço que permite conferir em vez de acreditar.

Onde enfiar a checagem: no terminei, ou a cada passo

Perguntaram exatamente isso na thread, e a resposta é honesta:

  • hoje ele checa quando o agente afirma que terminou. É o uso seguro.
  • checar a cada par de passos é tentador porque é barato, e ele diz que tem curiosidade de testar. Não testou ainda.
o relato de campo, que é a parte mais valiosa da thread

Um leitor que já rodava a checagem barata no terminei contou que ela pegou os términos falsos, mas que a checagem a cada turno começou a derrubar passos que o agente precisava tentar para chegar lá.

A pergunta dele: a sua alguma vez matou uma execução que teria dado certo sozinha?

A resposta de Saravia: precisa ser medido direito, e não existe benchmark bom para isso ainda.

verificação contínua é barata em dinheiro e não é de graça em qualidade

A cada passo, um verificador impaciente vira um chefe que interrompe. O caminho conservador é checar no terminei, e só depois medir se checar mais cedo ajuda ou atrapalha.

As ressalvas dele, que valem tanto quanto a ideia

  • Isso é para quem tem harness próprio. Ele mesmo diz que pode não fazer sentido para quem usa o /goal de fábrica do Codex ou do Claude Code, e que vai demonstrar com o Pi porque o harness dele não é público.
  • Ele acabou de começar. Os primeiros resultados são bons, e ele ainda precisa achar como medir. Nenhum número foi publicado.
  • Ele chama isso do caso de uso mais chato do Jev, de propósito: as demos espalhafatosas e irreais do X nunca chegam em produção, e o que eleva resultado é o uso sem graça.

O desenho pra Lain

A casa já tem o lugar exato, e ele está escrito: as done criteria de cada entry, em .lain/entries/<id>.md. Hoje quem decide se foram cumpridas é o modelo da sessão, no fim do trabalho, lendo o próprio relato. É o juiz julgando a causa dele.

O desenho: quando um despacho volta, um noul por critério de conclusão, com o estado sendo o relatório do subagent mais a lista de arquivos que ele tocou.

  • acima do corte, o trabalho está entregue
  • abaixo, a Lain reabre aquele critério específico antes de responder ao Biel

Vale para a regra da prova pelo mesmo motivo: implementei X sem evidência que se possa conferir é exatamente o término falso que o verificador pega.

Uma chamada de Jev não é um subagent.

a diferença que decide se isso cabe ou não

Não relê o contexto, não reexplora o projeto, não custa a janela duas vezes. Custa três décimos de segundo e uma fração de centavo. É por isso que cabe no fim de todo despacho, e um verificador de modelo grande não cabe.

12

O ecossistema na primeira semana: o que já dá pra pegar pronto

O Jev tinha menos de uma semana no ar quando isto foi escrito, e já existiam duas curadorias grandes (as duas de 18/09/2026), dezenas de repositórios públicos e integração em três lugares oficiais. Aqui está o que sobrou da triagem.

O que dá pra instalar hoje

nada disto foi testado aqui

É lista de candidato, não recomendação. As estrelas são as do dia em que a curadoria foi publicada.

o que existe pronto, e como se pega
o quêo que fazcomo pega
jev-model-routermod do Claude Code: a cada pedido, o Jev classifica o modelo do subagent, o modelo principal e o nível de esforçonpx claude-code-templates@latest --mod productivity/jev-model-router
fast-jev-compactioncompactação de contexto: tira do histórico as chamadas de ferramenta que já não importamrepositório da Tamara Tran, 2.790 estrelas
foremansupervisiona trabalho autônomo de agente de código279 estrelas
jev-reviewrevisão incremental de diff251 estrelas
jev-rulesescolhe que regra e que contexto carregar por arquivo3 estrelas, e é o que mais parece com o roteador da casa
langchain-typesafemiddleware oficial de roteamento de modelo, da LangChainpip install langchain-typesafe

O detalhe do jev-model-router que vale a leitura: ele classifica o modelo principal só no começo da sessão, de propósito, para não quebrar o cache. É a lição da seção 9, aplicada por outra pessoa, sem combinar.

O padrão que se repete em quase todos

Alimente candidatos. Não peça invenção.

o que os quarenta projetos têm em comum
  • o agente de browser monta o espaço de ações a partir do DOM a cada passo, e o Jev escolhe o próximo clique
  • o buscador traz os trechos como sempre trouxe, e o Jev apaga os que não servem
  • o lançador de arquivos rankeia, e o Jev re-rankeia a cada tecla digitada

É a mesma inversão da seção 10, e ela aparece sozinha em projeto de gente que não se conhece. Quando um padrão reaparece assim, ele é da tecnologia, não do autor.

Os números que saíram junto

Todos de terceiros, nenhum medido aqui, nenhum com metodologia publicada.

o que cada um relatou
o quênúmeroquem
busca de voo dentro de um agente de browser7,07s e US$ 0,0039Gregor Zunic, do browser-use
500 e-mails classificadossegundos, 3,5 centavosRiley Brown
compactar uma sessão de quase 1 milhão de tokens86 mil tokens, em cerca de 1sAlex Volkov, com o plugin da Tamara Tran
revisão de segurança antes de executaraté 18x mais rápido no p95time da Vercel
linter de prosa, 10 perguntas de sim ou não por parágrafo182ms de mediana, e 1 falso positivo em 54 parágrafos limpos contra 37 do HaikuDan Willoughby
busca em banco de dados em linguagem natural129 linhas julgadas em cerca de 1sa extensão pg-jev

O linter de prosa é o que mais interessa aqui: é a mecânica da ideia 6 (soa como você ou como IA), rodada por outra pessoa, e com o falso positivo medido, que é a parte que costuma faltar.

a ressalva do curador, que é a parte que ninguém lê

O autor da lista de 30 repositórios escreve no fim dela: confira o custo da API e o envio de dado a terceiro antes de usar, e ele mesmo não testou tudo.

O caso mais claro é a extensão de PostgreSQL, que manda as linhas do seu banco para a API deles. Vale reler a seção 17 inteira antes de plugar qualquer um desses num dado que não é seu.

13

Os números, com a fonte de cada um

Nenhum número aqui aparece sem dizer de onde veio.

anunciados pela própria TypeSafe
o quênúmerofonte
preço da entradaUS$ 0,042 por milhão de tokenspágina de modelos
preço da saídazeropágina de modelos
latênciade 70 a 500msdocs; medi 164ms no console deles
contexto64k por requisição, 32k para o textopágina de modelos
limite de vazão1.200 requisições por minutopágina de modelos
velocidade contra LLMde 20 a 200x mais rápidoanúncio deles (as fontes divergem: o anúncio diz 20 a 200x, um dos vídeos diz 40 a 200x)
custo contra LLMde 40 a 400x mais baratoanúncio deles
Diagrama desenhado à mão: duas redes neurais à esquerda, uma rotulada LLMs em cima e outra rotulada Jev embaixo, com setas de ambas para as mesmas três tarefas à direita, cada uma com um visto verde: Sorting Emails, Improving RAG e Model Routing. Entre elas, um colchete rosa marca a diferença de tempo, anotada como 40x a 200x mais rápido.
As tarefas são as mesmas nos dois. A diferença é só o tempo. Este frame diz 40x a 200x; o anúncio da TypeSafe diz 20x a 200x. A divergência é das fontes, não da leitura.

A calibragem honesta das manchetes de velocidade

A melhor formulação que li é de Manish Choudhary, depois de ele ler mais de dez artigos e cinco horas de vídeo. Os três números são todos verdadeiros, e o que muda é o que está sendo medido:

7xquando é uma decisão dentro de um laço maior
25xnuma comparação justa, igual contra igual
200xquando o fornecedor escolhe a carga

É essa a régua para ler tanto o 20 a 200x do anúncio quanto o 250x que circulou nos grupos. E o 193,6x que a Vercel repete no changelog dela vem das avaliações da própria TypeSafe contra um modelo de meio de tabela, não contra um de fronteira.

o teste de acurácia mais limpo publicado até agora

Mike Taylor plantou sete defeitos num texto. O Jev pegou seis. O modelo de fronteira pegou os sete, levando 25 vezes mais tempo.

E no benchmark de quatro fluxos da própria TypeSafe, o Jev tira 67,8%, empatado com o GPT-5.6 Terra e alguns pontos atrás do Sol e do Opus 5.

Medidos por terceiros

O único benchmark independente de verdade, do Greg Pstrucha, num pipeline de segurança que ele já rodava em produção:

acerto, latência e custo por mil, no mesmo pipeline arraste para o lado para ver tudo
modeloacertolatênciacusto por mil
TypeSafe Jev99,3%0,259sUS$ 0,026
Gemini 3.1 Flash-Lite99,3%1,338sUS$ 0,372
Gemini 2.5 Flash-Lite97,4%0,616sUS$ 0,071
Qwen3 Next 80B A3B97,1%0,745sUS$ 0,119
Gemini 2.5 Flash97,4%0,755sUS$ 0,239
GPT-OSS 120B96,4%1,821sUS$ 0,080
Gemini 3.7 Flash96,4%2,098sUS$ 0,769
99,3% empata em acerto com o Gemini 3.1 Flash-Lite, que custa 14 vezes mais e leva 5 vezes mais tempo
Gráfico de dispersão da média de quatro workflows: acerto no eixo vertical, de 40 a 80 por cento, contra custo por workflow em dólares no eixo horizontal em escala logarítmica. Uma linha marca a fronteira do que é ao mesmo tempo mais barato e mais preciso. O ponto do Jev, da TypeSafe, fica na ponta esquerda dessa fronteira, perto de 67 por cento de acerto a um custo dez vezes menor que o próximo ponto da linha.
Olhe só o eixo de baixo, que é logarítmico. O Jev não é o mais preciso do gráfico: ele é o ponto mais à esquerda da fronteira, o que é o mesmo que dizer que nada mais barato acerta mais.

Outros, de terceiros

  • 1.000 e-mails, 7 classificações cada: 6 segundos e 9 centavos. O mesmo com GPT 5.6 Luna: 5 minutos e 62 centavos. (Nate Herk)
  • 20.000 requisições por 85 centavos. (Nate Herk)
  • 1.700 e-mails com 4 saídas cada: 18 centavos. (Ryan Vogle)
  • Custo mensal a 10 mil decisões por dia: Jev US$ 10, GPT-5.6 Luna US$ 55, GPT-5.6 Sol US$ 1.080, GPT-6 Astra US$ 2.700. (painel do Nate Herk)
  • Medidos pelo Denderson, no manual dele, cada um com a ressalva escrita por ele: no caso real do Hermes, 15 chamadas numa tarefa de construção de site, média de 908ms, sem A/B suficiente para atribuir economia; e duas chamadas reais feitas na edição do próprio manual, 778ms com 709 tokens de entrada e 917ms com 546 tokens, a primeira com confiança 0,84. A conta de 37,5% de economia que aparece no manual é declaradamente simulada, não medida.
Captura do modal Cost comparison de uma plataforma que usa o Jev. Uma tabela lista o mesmo trabalho de mil posts precificado em cada modelo, com colunas de preço por milhão de tokens, custo da última rodada, custo por mil posts, total acumulado e uma coluna final chamada Against Jev, que vai de 1x no Jev a 8x, 71x, 177x e 354x nos modelos maiores.
A coluna que importa é a última. É o mesmo trabalho, com os mesmos tokens, precificado na tabela de cada modelo, e ela transforma a economia numa coluna de centavos que dá pra mostrar numa call.

Medidos por mim, no workspace

298xmais barato que o Opus 5 nas mesmas 20 chamadas
US$ 0,05um dia inteiro de experimento, com 1,2 milhão de tokens
14

O que ele NÃO faz

Esta seção evita a maior parte da frustração.

  • Não escreve nada. Nem uma palavra. Precisa de texto? O Jev decide e outro modelo escreve.
  • Não resume, não acha tema, não faz análise aberta. Ele não olha 1.000 transcrições e diz o que está errado nas suas calls. Ele responde 1.000 vezes a pergunta que você escreveu, e você lê o resultado e tira o tema.
  • Não extrai valor, escolhe entre valores. Ache os candidatos com código ou com outro modelo, e deixe o Jev escolher qual é o certo.
  • Não conta, não faz conta, não compara data. Aritmética fica no código. Pra data: extraia as partes (mês, dia e ano são conjuntos pequenos e fechados) e monte a data você.
  • 64k de contexto, contra o milhão dos modelos grandes. Filtre antes de mandar: a acurácia cai quando o texto vem cheio de coisa que não interessa à pergunta.
  • Ele é literal. Responde a pergunta que você escreveu, não a que você quis dizer.
  • Não vê imagem nem áudio. Só texto.

Quando você olha uma resposta errada e se pega explicando o que queria dizer, essa explicação é a metade que faltava na pergunta.

a regra deles, que eu confirmei na prática
duas frases que são superinterpretadas

Não alucina quer dizer que ele não quebra o formato. Não quer dizer que ele não erra. Ele nunca inventa uma opção fora da lista, mas pode escolher a errada.

Não trata o texto de entrada como hostil por padrão. Texto escrito pra manipular o modelo pode mover a resposta.

elogio, não defeito

Numa tarefa que comprovadamente não tem sinal, ele parou 17 de 20 respostas em exatamente 0,50.

Ele diz não sei em vez de inventar um palpite.

15

É revolucionário? A resposta honesta

O que eles mesmos admitem

Esta é a parte que me fez confiar mais neles, não menos. As ressalvas abaixo estão escritas pela própria TypeSafe, no blog de lançamento.

as ressalvas da própria TypeSafe

O número da manchete é o teto, não o típico. Sobre os 193,6x mais rápido e 444,6x mais barato, eles escrevem que esperam que estejam no lado mais alto dos ganhos reais.

A velocidade foi medida dos laptops deles, na costa oeste.

Sobre o preço, eles escrevem que não conseguem provar que não é subsidiado.

O zero de alucinação não é medido. A frase deles: o número não é empírico. Ele é deduzido da garantia de formato, não observado.

A avaliação não tem gabarito. A referência de acerto é a média de dois modelos grandes (GPT-6 Astra e Fable 5.1), não a verdade. E os fluxos de teste foram escritos pelo time deles, que admite que algum viés pode existir.

A home diz Versão 0.01.

Some a isso o que vem na crítica, mais abaixo: não existe paper, nem arquitetura publicada, nem avaliação de terceiro em conjunto padrão.

E tem uma cláusula no contrato que você precisa saber que existe

O contrato deles (o MCA, atualizado em 27/08/2026) proíbe o cliente de publicar benchmarks ou informação de desempenho sobre os Serviços.

Isso foi notado publicamente no X nos primeiros dias. Uma conta respondeu a um resultado publicado dizendo que quem publicou já tinha violado os termos de uso. Outra apontou que a cláusula derruba boa parte do uso acadêmico.

por que isso é seu problema, e não teórico

O relatório e este dossiê são exatamente isso. A ideia de mostrar a coluna de centavos numa call de venda é exatamente isso.

Eu não sou advogada e não vou dizer o que você pode fazer.

Uso interno e decisão sua não têm problema nenhum. Publicar comparativo de desempenho com o nome deles é o que a cláusula alcança.

o que dá pra dizer com segurança, lendo o contrato

Se for virar conteúdo, vale ler a cláusula antes. O caminho seguro é ensinar o padrão (o funil, o portão de confiança) em vez de publicar a tabela de quem é quantas vezes mais caro.

O que muda de verdade

Não é capacidade. É preço e latência.

Um LLM sempre conseguiu classificar e-mail. O que ele nunca conseguiu foi classificar todos os seus e-mails, todo dia, por centavos, em segundos.

Isso muda a pergunta que você pode fazer aos seus dados. Em vez de amostrar, você passa o corpus inteiro.

Jev é só um comando de decisão muito inteligente. Como se os classificadores de 2016 tivessem ganhado a inteligência de 2026.

Nathan Flurry, no X

Tem uma segunda, mais curta, que virou a mais repetida: um if de IA.

E tem a admissão do próprio autor. Quando um comentarista do Hacker News escreveu que aquilo é fundamentalmente um modelo de classificação e não um LLM, Almeida concordou, preferindo chamar de zero-shot em vez de instruction-tuned. Quem vende não está fingindo que é outra coisa.

E o principal: ele não substitui o GPT nem o Claude.

O tamanho do barulho

  • O post de lançamento passou de 600 mil visualizações.
  • O conteúdo de maior alcance não é da TypeSafe: é o artigo Building a Harness with Jev, da LangChain, com 1,5 milhão de visualizações. O ângulo é exatamente o da seção 9 deste dossiê.
  • A Vercel publicou que é o modelo de adoção mais rápida da história do AI Gateway: em 24 horas, quase 13% dos times pagantes usando, o dobro da família GPT-5.6.

A crítica, que é justa

o que ainda não foi provado

Quase todo número que circula é da própria TypeSafe. Até o 194x mais rápido que a Vercel cita é atribuído a eles, não medido por ela.

Não existe paper, arquitetura publicada nem eval de terceiro em dataset padrão.

Não alucina é a frase mais superinterpretada do lançamento.

Um LLM comum também devolve resposta estruturada quando você o configura para isso. Essa frase não é de crítico: está no rodapé do infográfico de um entusiasta. O que o Jev tem de diferente não é o formato, é o preço, o tempo e a probabilidade calibrada que vem junto.

Depender de um modelo fechado sem concorrente maduro é risco de ponto único.

Muita demo de fim de semana, pouco dado de produção. A separação aparece em dois meses, quando houver número de retenção e de falso positivo.

um relato honesto de fracasso

Alguém testou triagem de 50 casos históricos, não bateu o corte de 90% que tinha definido, e abandonou o desenho.

É exatamente o que aconteceu comigo no alvo de alcance.

Já tem alternativa aberta, e em dias

  • Laya, aberto, no Hugging Face, com quem publicou afirmando que já passou o Jev em velocidade.
  • SimpleJev.ai, de Eugene Cheah: biblioteca aberta que pega qualquer modelo do Hugging Face e transforma num Jev, com endpoint de API, rodando em produção.
  • Nimble, da Bespoke Labs, no GitHub. E vários outros: NanoJev, Kev, Jever, OpenJev.
  • CUA-S1, da trycua, que é um dado diferente dos outros. Não é clone de Jev: é a mesma aposta noutro domínio. São modelos pequenos que decidem sobre elementos de interface (que valor vai no campo, clicar ou deixar quieto) em vez de texto, e eles usam a expressão System 1 pelo mesmo motivo, dizendo explicitamente que é analogia de engenharia para decisão rápida e limitada, não classificação de arquitetura. Código MIT, pesos abertos no Hugging Face, sem alegação de desempenho. Não existe relação nenhuma com a TypeSafe, nem citação nem parceria: procurei, e o nome deles não aparece uma vez. É por isso que serve de segundo dado. A categoria está nascendo em mais de um lugar ao mesmo tempo, e a versão aberta dela é inspecionável, coisa que o Jev fechado não é.

O que isso significa pra você: o formato provavelmente vira commodity. O que não vira commodity é saber quais decisões da sua operação são decisões fechadas, e ter o conjunto de teste que prova a troca.

Construa em cima do contrato, não em cima do fornecedor.

o adapter.mjs daqui já provou: trocar o motor por trás do mesmo contrato é mudar uma linha
16

Como usar hoje, na prática

Três caminhos, do mais direto ao mais indireto.

  1. API direta. POST https://api.typesafe.ai/v1/systemone, com a chave no cabeçalho e um corpo com state, model e questions. É o que roda aqui.
  2. SDK de Python ou de JavaScript, que já repete sozinho quando bate no limite.
  3. Pelos intermediários. OpenRouter, Vercel AI Gateway e Zapier já expõem o Jev, então dá pra usar sem conta na TypeSafe. No Gateway o id é typesafe-ai/jev, e ele não funciona pelos endpoints compatíveis com OpenAI: precisa da API de evaluation do AI SDK. Entraram também o Cloudflare Workers AI (como typesafe/jev) e o LiteLLM, que passou a suportar o endpoint deles com contagem de custo (esta via veio de resumo de IA, não de fonte primária: confira antes de contar com ela).

Onde aprender: docs.typesafe.ai/llms.txt é o índice, e qualquer página vira markdown puro botando .md no fim da URL. O console tem um Playground com três casos prontos e mostra a latência real de cada chamada.

Duas coisas do console que valem copiar

  • Mande o texto como objeto JSON com campos nomeados e aponte pro campo na pergunta com crase: `user_message`. É como o exemplo pronto deles faz, e é melhor que mandar texto cru.
  • jev-latest é apelido e hoje aponta pro jev-1.13.0. Se você calibrar um corte de confiança, fixe a versão, porque o apelido anda.
sobre gratuidade

Não existe nada de graça documentado. As páginas da Vercel mostram o mesmo preço de US$ 0,042 por milhão e um exemplo de resposta com custo cobrado.

Circulou a informação de que alguns gateways estavam com preço promocional zerado, terminando por volta de 25/09/2026. Eu não consegui confirmar isso em fonte primária.

Se a sua conta está zerada, a explicação mais provável é essa, ou crédito da conta. Vale conferir antes de contar com isso.

a reclamação de quem rodou em produção

A mais comum de quem saiu da demo: estouro de limite de taxa (erro 429) sob carga real, principalmente pelos gateways.

O cliente que eu escrevi aqui já repete sozinho com espera crescente quando isso acontece.

Ligar em produção sem quebrar o que já funciona

Três regras do manual do Denderson, que são de operação e não de modelo:

  1. Rollout em três estágios. Primeiro observação (registra a decisão e não muda nada), depois consultivo (a decisão vira sugestão reversível), e só então seleção automática, quando a comparação sustentar. Intervenção sensível começa em observação, sempre.
  2. A chave de cache não é o texto. Ela precisa levar junto o tenant, a versão do modelo, a versão das perguntas, o estado normalizado e a evidência. Mesmo texto vindo de outra conta não é o mesmo evento, e decisão de autorização não se reaproveita nunca.
  3. Fallback em cinco casos: timeout, 429, 5xx, JSON inválido e confiança baixa. Todos caem no fluxo que existia antes. Retry cego é desaconselhado, e falha em sequência deve abrir o circuito.
a regra que desarma o entusiasmo

Isso só vira economia quando a integração substitui trabalho ou tira contexto do modelo caro. Acrescentar uma chamada de Jev sem mudar o fluxo aumenta o custo e a latência em vez de baixar.

17

Antes de pôr dado de cliente ali dentro

Você processa dado que não é seu: paciente de clínica, lead, extrato bancário. Então isto não é detalhe.

O que está escrito, e onde diverge

Treinar nos seus dados. A política de privacidade é categórica: não treinam nem ajustam modelo com o que você manda. Mas o contrato diz outra coisa em dois pontos. Ele proíbe incluir dado do cliente em treino sem o consentimento prévio do cliente (ou seja, com consentimento, pode). E trata telemetria (logs, estatísticas, classificações e aprendizados ligados ao uso) como coisa que eles podem processar sem restrição, inclusive pra melhorar o produto. Telemetria é derivada do seu dado e fica fora da promessa.

  • Retenção: não existe prazo publicado. Nenhum documento diz por quantos dias guardam. O contrato vai na direção oposta: diz que eles não têm obrigação de guardar e podem apagar quando quiserem.
  • Zero data retention existe, em uma linha, e só pra enterprise. Pede-se por e-mail.
  • O DPA é público e vale pra todo cliente, porque o contrato o incorpora. Ele traz aviso de incidente em até 72 horas, auditoria uma vez por ano às custas do cliente, e transferência internacional coberta por cláusulas padrão da União Europeia.

As três coisas que eu destacaria pra você

1. dado de paciente: não

No DPA, o campo de dado sensível transferido está preenchido como não aplicável. E não existe menção nenhuma a HIPAA, a acordo de uso de dado de saúde, nem a dado de saúde em lugar nenhum dos documentos.

Para a Ana e para a Clínica Total, isso quer dizer: classifique o comentário e a DM, que são públicos ou comerciais, e não mande prontuário, histórico clínico, nem nada que ligue uma pessoa a uma condição.

2. Não existe menção a LGPD nem à ANPD, e o serviço é hospedado nos Estados Unidos. A base legal do dado que você manda é responsabilidade sua: o contrato diz expressamente que o cliente declara ter obtido os consentimentos necessários.

3. O teto de responsabilidade deles é o maior entre o que você pagou nos últimos 12 meses e US$ 50. Com o preço deles, na prática:

US$ 50 é o teto de responsabilidade na prática. Dimensione a confiança nisso.

Detalhe comercial: os créditos comprados expiram, no fim do contrato ou 12 meses depois da compra, o que vier primeiro.

18

Como sair na frente

O gargalo não é acesso ao modelo. Qualquer um tem em 5 minutos.

O gargalo é saber quais decisões da sua operação são decisões fechadas, e ter o conjunto de teste que prova que a troca funcionou.

  1. Liste as decisões, não as tarefas. Onde hoje um modelo caro é chamado só pra devolver um rótulo, uma nota, ou um sim ou não. Aqui na casa eu já listei 29 desses lugares.
  2. Ache a verdade que já existe de graça. A sua planilha de categorias. O que você já respondeu na mão mês passado. O que você já escolheu publicar. Sem isso, você não tem como saber se melhorou.
  3. Meça antes de ligar. Cem casos, os dois modelos, três colunas: acerto, custo, tempo. Foi o que separou aqui isto vale ligar hoje de isto não tem solução.
  4. As contas, escritas. Tokens evitados são os do baseline menos os do modelo principal com o Jev; a economia é isso dividido pelo baseline; o custo total novo é o modelo principal mais o Jev mais infraestrutura; o acerto é decisões certas sobre decisões avaliadas; e a cobertura automática é decisões aplicadas sem fallback sobre eventos elegíveis. Três armadilhas: compare p50 e p95, não a média; token economizado não vira dólar quando o modelo caro é assinatura e não API; e não mude duas coisas de uma vez, como baixar o nível de raciocínio do modelo junto e creditar a diferença ao Jev.
  5. Use a confiança como portão desde o primeiro dia. A parte de cima roda sozinha, a parte de baixo continua com você. É o que transforma 84% de acerto em 100% de acerto na metade do trabalho.

A oportunidade comercial

Aparece em dois dos vídeos e encaixa direto no que você vende: a maior parte das automações que os seus alunos e clientes montam hoje queima modelo grande numa etapa de triagem.

Trocar essa etapa é um ganho de custo mensurável e fácil de mostrar numa call, porque a prova é uma coluna de centavos.

19

As 29 ideias pra casa

Cada uma diz o que a casa faz hoje e o que muda. As marcadas foram rodadas de verdade; as outras não, e estão aqui como lista de candidatas.

  • provado que funciona, com número
  • provado que NÃO funciona

conteúdo e Business de IA

  • 01banco de ideias, ao salvarHoje toda ideia entra igual e vira uma carta no painel. Com isto, cada ideia já entra pontuada em dá carrossel, dá reel, dá newsletter, e com um aviso de isto parece o que você já postou em agosto.
  • 02radar vira pauta provadoJá rodado: 64,3% contra 23% de acaso. O modelo grande continua escrevendo a pauta, só para de ler as 7 histórias que iam ser descartadas.
  • 03dedupe do radarHoje o radar junta o que chegou por e-mail e repete história que já saiu ontem com outro título. Uma pergunta resolve: esta história é a mesma daquela?.
  • 04newsletter, o corte da ediçãoMesma mecânica da pauta, aplicada ao que entra na edição de sábado.
  • 05carrossel, o slide cumpre a capa?Uma pergunta por slide. A capa promete 5 erros e o slide 4 fala de outra coisa: isso aparece antes de virar PNG.
  • 06carrossel, soa como você ou como IA?O motor já tem o voz.md. A pergunta compara o slide com a voz e devolve a probabilidade, e o que ficar embaixo do corte volta.
  • 07feed-mock, a capa para o dedo?Hoje o feed-mock mostra a capa entre 6 posts reais e você julga no olho. A pergunta dá a nota antes, e você julga só as duvidosas.
  • 08termômetro do XClassificar cada tweet colhido por tema, sem gastar modelo grande numa tarefa que é escolher entre 8 caixas.
  • 09prever alcance pela legenda provado que NÃORodado, e não funciona: dois modelos de tamanhos muito diferentes empatam no acaso. O problema é a tarefa, não o modelo. Serve de alerta: nem toda pergunta tem resposta no texto.

clientes

  • 10fila de leadsCada lead recebe três notas (urgência, orçamento aparente, encaixe com o que você vende) e a fila se ordena sozinha. O peso fica no código, então mudar prioridade é mudar um número.
  • 11proposta contra a callDepois de gerar a proposta, uma pergunta por item que o cliente pediu na call: a proposta cobre isto?. O que ficar sem cobertura aparece antes de você mandar.
  • 12comentário e DM dos anúnciosNos anúncios da Ana e da Clínica Total: separar paciente de curioso de spam antes de alguém abrir o direct.
  • 13relatório semanal, o que vira alertaHoje o relatório mostra tudo igual. A pergunta decide quais números merecem uma linha em destaque.
  • 14dúvidas dos alunos do Dr. LucasAgrupar as repetidas, que é o que vira FAQ e o que vira aula nova.
  • 15triagem do Inbox de arquivos soltosA pasta Inbox existe pra one-off sem casa. A pergunta sugere o domínio de destino e você só confirma.

a casa

  • 16o roteador do catálogo provado84,5% de acerto nas 56 entries, e no corte de confiança 0,9 acerta 100% em metade dos pedidos. O Jev na frente, o modelo da sessão só no que ficar abaixo do corte.
  • 17guardrail de injeção provado10 de 10 ataques pegos, 0 falso positivo em 120 textos reais. O lugar é a entrada do radar e do coletador de referências.
  • 18isto é pedido ou é conversa?A saída nenhuma do roteador já faz isso: separa bom dia de monta a proposta do Fernando sem acordar workflow nenhum.
  • 19triar backlogCada cartão do quadro contra o que existe no disco: isto já foi feito?, isto ainda faz sentido?. Hoje a triagem é leitura na mão.
  • 20o doctor, ruído contra quebradoClassificar cada linha de erro em quebrado de verdade ou barulho conhecido, pra saudação só trazer o primeiro.
  • 21e-mail da casaDecidir se um e-mail merece virar aviso hoje ou pode esperar o resumo.
  • 22classificar pasta nova no lain-aprendeAs cinco caixas do CLAUDE.md (agente, skill, cron, projeto, experimento) são literalmente uma pergunta de escolha única.
  • 23Todoist, o freio do P1Ao criar tarefa, prever se ela é de 2 a 5 minutos ou se é sapo de dia inteiro, e avisar quando um segundo P1 tentar entrar.
  • 24ritual de domingoCada tarefa parada recebe ainda faz sentido? e a lista de reanimar sai pronta.

vida pessoal

  • 25fechamento do mês provado70,8% na pilha que hoje vira pergunta em lote, e no corte 0,5 resolve 76% dela sozinho.
  • 26coletor de imóveisO filtro de preço e metragem já é código. O que falta é o que só está escrito no anúncio: aceita pet, é mobiliado, a foto é de reforma inacabada.

vindas do material de 20/09/2026

  • 27o verificador de fim de despachoHoje quem diz que as done criteria da entry foram cumpridas é o modelo da sessão, lendo o próprio relato. Um noul por critério, com o relatório do subagent e os arquivos tocados como estado, e o que ficar abaixo do corte volta antes de virar resposta. É o juiz deixando de julgar a própria causa.
  • 28roteador de modelo e de esforço por pedidoClassificar qual modelo do subagent, qual modelo principal e que nível de esforço cada pedido merece. Já existe pronto como mod do Claude Code, e o detalhe que ele acertou é classificar o modelo principal só no começo da sessão, para não quebrar o cache.
  • 29compactação de contextoTirar do histórico da sessão as chamadas de ferramenta que já não importam, em vez de resumir tudo. O plugin de terceiro levou uma sessão de quase 1 milhão de tokens para 86 mil em cerca de um segundo.