Em 25 de setembro de 2026, a TypeSafe AI anunciou o Jev, o primeiro modelo naquilo que chama de categoria "System One": não um chatbot, e não simplesmente um modelo de linguagem maior, mas o que a empresa descreve como um modelo de decisão — algo construído para responder a uma pergunta delimitada com uma resposta tipada e calibrada em vez de um parágrafo de texto corrido. O anúncio é denso em números específicos, então este texto examina cada um exatamente como foi apresentado, marca com clareza o que conseguimos e o que não conseguimos verificar, e analisa por que a ideia de fundo, decidir em vez de gerar, merece ser levada a sério especialmente para software de segurança.
O que a TypeSafe de fato anunciou
A TypeSafe AI foi fundada por Diogo Almeida, que escreve no anúncio: "Na OpenAI, ajudei a construir os métodos que tornaram os modelos de linguagem úteis para seguir instruções e conversar com pessoas." O Jev, chamado pela empresa de "primeiro modelo público", é apresentado como uma função inteiramente diferente: produzir o que a TypeSafe chama de valores estruturados com segurança de tipo, com probabilidades e índices de confiança calibrados, gerados por meio do que ela nomeia de amostrador paralelo em vez da decodificação token a token usual, e treinados com um método que a empresa chama de Reinforcement Learning for Calibrated Decisions, ou RLCD.
- A TypeSafe relata um tempo de resposta de ponta a ponta de "70ms a 500ms", contra o que mediu como "3 a 329 segundos" para os modelos de linguagem de ponta com os quais comparou o Jev.
- A TypeSafe precifica os tokens de entrada em "US$ 0,042 / MTok", com os tokens de saída listados como gratuitos.
- Em suas próprias avaliações de fluxo de trabalho, a TypeSafe relata que o Jev roda "193,6 vezes mais rápido, 444,6 vezes mais barato" do que as políticas contra as quais foi medido.
- A TypeSafe descreve um erro de tipo na saída do Jev como, em suas palavras, "matematicamente impossível".
- O Jev está em acesso antecipado; a TypeSafe diz que está liberando desenvolvedores "da lista de espera o mais rápido que consegue".
Geração versus decisão
Boa parte do que se chama de "IA em produção" silenciosamente não é uma tarefa de escrita. Permitir ou bloquear uma conexão. Escalar ou encerrar um chamado. Sinalizar ou liberar uma transação. Encaminhar uma mensagem para uma fila ou outra. A saída desejada não é um texto corrido, é um rótulo tirado de uma lista curta e fixa, às vezes com uma pontuação associada. Passar esse tipo de pergunta por um modelo construído para produzir parágrafos fluentes é um descompasso: volta um blob JSON que precisa ser analisado e, com sorte, é válido, e qualquer confiança declarada tende a não significar muito em particular, porque nada obrigou o modelo a acompanhar sua taxa de erro real.
Vale separar duas afirmações aqui, porque não são a mesma coisa: tipado e calibrado. Uma saída tipada restringe o formato da resposta — uma pergunta de "escolha" retorna uma das opções da lista, uma "pontuação" retorna um número dentro de um intervalo declarado, nunca uma frase solta ou um campo inventado. Calibração é uma ideia bem mais antiga e inteiramente separada. É uma propriedade estatística, não estilística: significa que, quando o sistema declara uma probabilidade de 0,62, ele está certo com essa frequência ao longo de muitas previsões parecidas, de modo que um programa a jusante pode de fato usar esse número como limiar em vez de tratá-lo como decoração.
O próprio nome escolhido pela TypeSafe toma emprestado seu vocabulário da psicologia, não da estatística. Daniel Kahneman, que recebeu o Prêmio Nobel Memorial de Ciências Econômicas em 2002 "por ter integrado percepções da pesquisa psicológica à ciência econômica, especialmente sobre o julgamento humano e a tomada de decisão sob incerteza", popularizou os termos em Rápido e Devagar: Duas Formas de Pensar: o "Sistema 1" é "rápido, automático, frequente, emocional, estereotipado, inconsciente", enquanto o "Sistema 2" é "lento, trabalhoso, infrequente, lógico, calculista, consciente". A metáfora é evocativa, mas descreve a cognição humana, não uma garantia sobre um software. Um modelo pode ser rápido da mesma forma que o Sistema 1 é rápido, sem que sua confiança declarada signifique absolutamente nada — calibração precisa ser conquistada e medida, não sugerida por um nome.
O que "não pode alucinar" pode e não pode significar
A afirmação da TypeSafe de que um erro de tipo é "matematicamente impossível" está descrevendo a decodificação restrita, uma técnica que já existe em outros lugares. O próprio guia de Structured Outputs da OpenAI faz uma garantia parecida: o recurso, segundo ele, "garante que o modelo sempre gerará respostas que seguem o JSON Schema fornecido, então você não precisa se preocupar com o modelo omitir uma chave obrigatória ou alucinar um valor de enum inválido". Essa garantia é real e útil. Também é mais restrita do que parece: ela limita o formato da resposta, não se a resposta está correta. Uma pergunta de "escolha" com três opções sempre retornará uma das três — inclusive, se o modelo tiver julgado mal a entrada, uma resposta confiante, validamente tipada e errada.
Calibração é a parte que precisa ser verificada, não apenas afirmada. A ferramenta padrão é um diagrama de confiabilidade: agrupe previsões pela confiança declarada e, para cada grupo, plote a frequência com que essas previsões de fato se confirmaram; a diferença entre a diagonal e a linha observada costuma ser resumida como erro esperado de calibração. Essa não é uma questão nova para o aprendizado de máquina — o artigo de Guo et al. de 2017, "On Calibration of Modern Neural Networks", constatou que "redes neurais modernas... são mal calibradas" por padrão, e que uma correção simples, de um único parâmetro, chamada de escalonamento de temperatura, foi "surpreendentemente eficaz" para corrigir isso. A lição vai além desse artigo: calibração não é uma propriedade que um modelo pode anunciar sobre si mesmo. É algo que se verifica, nos seus próprios dados rotulados, porque tende a se degradar exatamente onde mais se precisa dela — em entradas que não se parecem em nada com aquilo em que o modelo foi ajustado.
Um arcabouço mínimo de avaliação (modelo)
Antes de encaminhar uma decisão real por qualquer modelo de decisão, seja o Jev ou outro, três perguntas importam mais do que qualquer número de fornecedor: a resposta tipada sempre passa na validação contra o seu schema, uma confiança declarada acompanha sua taxa real de acerto em uma amostra rotulada dos seus próprios dados, e essa calibração se sustenta em entradas diferentes de tudo que o modelo já viu. O esboço abaixo é um modelo construído em torno do formato de requisição mostrado na própria documentação de início rápido da TypeSafe. Ele não faz nenhuma afirmação sobre o que rodá-lo contra o Jev mostraria — não o executamos, e isto é pseudocódigo ilustrativo, não um relatório.
# Illustrative pseudo-code. Mirrors the request shape shown in TypeSafe's own
# quickstart docs (POST /v1/systemone with state, model, and typed questions).
# Not run against Jev or any live API; no results are claimed here.
import requests
def ask(state: str, question_id: str, question: dict) -> dict:
resp = requests.post(
"https://api.typesafe.ai/v1/systemone",
headers={"Authorization": f"Bearer {API_KEY}"},
json={"state": state, "model": "jev-latest", "questions": {question_id: question}},
)
return resp.json()["answers"][question_id]
# 1. Shape check: does every response parse against the declared type, on your
# own edge cases, not just a vendor demo set?
# 2. Calibration check: bucket the stated confidence and compare it to the
# true label rate, on data the model has never seen.
buckets = {i: {"n": 0, "correct": 0} for i in range(10)}
for state, true_label in labeled_sample: # your own traffic, labeled by hand
answer = ask(state, "decision", {"type": "noul", "instructions": "Should this be allowed?"})
bucket = min(int(answer["noul"] * 10), 9)
buckets[bucket]["n"] += 1
buckets[bucket]["correct"] += int(round(answer["noul"]) == true_label)
for b, s in buckets.items():
if s["n"]:
stated = (b + 0.5) / 10
observed = s["correct"] / s["n"]
print(f"stated~{stated:.2f} observed={observed:.2f} n={s['n']}") # the gap here is your calibration error- Se a resposta tipada sempre é válida, em entradas que o seu próprio sistema produz, não apenas no conjunto de demonstração de um fornecedor.
- Se uma confiança declarada de 0,9 está certa nove em cada dez vezes no seu próprio tráfego rotulado, não no conjunto de avaliação de outra pessoa.
- Se essa calibração se mantém em entradas diferentes de qualquer coisa já vista antes: um app novo, um protocolo novo, um remetente que leu o mesmo anúncio que você acabou de ler.
- O que quem chama o modelo faz diante de um tempo limite ou de uma indisponibilidade, já que um sistema de decisão precisa de um padrão seguro para quando o modelo de decisão estiver inacessível.
Por que isso importa para ferramentas de segurança
Um firewall, um filtro de spam, uma checagem de fraude, uma fila de triagem: cada um desses é um sistema de decisão, respondendo repetidamente ao mesmo formato de pergunta — dada esta entrada, permitir ou bloquear, com que confiança, e onde fica o limiar. A própria página de avaliações da TypeSafe tira seus exemplos exatamente desse território: julgar se deve fechar um alerta de segurança, escalá-lo para uma pessoa ou contê-lo imediatamente é uma decisão de triagem, não uma tarefa de escrita, e é o tipo de chamada que uma ferramenta de segurança faz constantemente, em um volume que nenhum analista conseguiria revisar manualmente.
| Resposta de um LLM generativo | Decisão tipada (estilo Jev) | |
|---|---|---|
| Saída | Um parágrafo explicando que a conexão com um endereço desconhecido em uma porta incomum "poderia valer a pena revisar" | { allow: false, confidence: 0.81 } |
| Análise | Regex, ou uma segunda chamada ao modelo, para extrair uma ação do texto | Garantido que corresponde ao schema declarado |
| Definição de limiar | Sem confiança numérica para comparar com uma política | Um valor de confiança que quem chama pode usar diretamente como limiar |
| Modo de falha | Fluente, com aparência plausível, e às vezes simplesmente errado | Errado, mas com um número associado, que uma checagem de calibração ao menos consegue detectar em média |
A troca de privacidade, com honestidade
O Jev, como a TypeSafe o descreve, é uma API hospedada: uma requisição carrega "state", ou seja, quaisquer dados sobre os quais a pergunta trata, até os servidores da TypeSafe pela internet. Para os exemplos de incidente de segurança e triagem que a própria TypeSafe destaca, esse state é exatamente o tipo de informação que muita gente preferiria não entregar a terceiros por padrão — qual aplicativo está falando com qual endereço, com que frequência, a partir de qual dispositivo. Enviar isso a qualquer modelo na nuvem, por mais rápido ou barato que seja, significa que esses dados saem da máquina de onde vieram.
O FireAI, o firewall para Mac da própria HisnLabs, fez a escolha oposta exatamente para a categoria de decisão de que este artigo trata. O FireAI roda no macOS 14 ou posterior em Apple silicon, por um pagamento único de € 49, e explicitamente não é um antivírus nem uma VPN. Quando um aplicativo que você nunca viu antes tenta acessar a rede, o FireAI pode rodar um modelo pequeno no próprio dispositivo — um download opcional de 1,5 GB — para analisar essa conexão e mostrar um aviso com um motivo em linguagem simples; o tráfego analisado nunca é enviado a lugar nenhum. Cada uma dessas decisões assistidas por IA se torna uma regra visível, vinculada à assinatura de código do aplicativo, que você pode ver e desfazer, ao lado de listas de ameaças que são aplicadas localmente em vez de consultadas em um servidor remoto.
Não estamos afirmando que o modelo no dispositivo do FireAI se equipara ao Jev, ou a qualquer outro modelo "sistema um", em correção bruta, velocidade ou preço — não fizemos essa comparação e não temos avaliações próprias para publicar aqui. O que este anúncio de fato sustenta é uma direção de design: que uma decisão de segurança é bem servida por um modelo pequeno, rápido e delimitado, rodando perto dos dados, em vez de encaminhada para um chatbot de propósito geral em algum outro lugar. A TypeSafe defende esse caso pelo lado da API; o FireAI já se apoia nisso pelo lado do dispositivo, e por um motivo diferente — porque, especificamente para um firewall, os dados em questão não deveriam precisar sair da máquina para serem avaliados.
Questões em aberto
- Avaliações independentes: nenhuma parte externa ainda publicou uma reprodução dos múltiplos de velocidade ou custo do anúncio da TypeSafe, em dados que a TypeSafe não escolheu.
- Calibração sob mudança de distribuição — exatamente o cenário do artigo de Guo et al., e o que mais importa diante de um adversário que se adapta assim que um método de defesa se torna público.
- Se a precificação se sustenta em volume real de produção, e se a latência declarada se sustenta sob carga contínua em vez de uma única requisição de demonstração.
- Como o modelo se comporta em entradas adversárias ou genuinamente ambíguas, nas quais uma resposta tipada e confiante pode ser menos honesta do que uma resposta que diz "incerto".
- Quando o acesso antecipado se abrirá além da lista de espera, para quem, e sob quais termos para os dados enviados como "state".
Por ora, o Jev é um conjunto de afirmações de uma equipe com credenciais reais e ainda sem verificação externa. A categoria que ela tenta nomear, modelos de decisão em vez de modelos de geração, aponta para uma lacuna real em como o software de segurança tem sido feito para usar IA até agora. Independentemente de o Jev em si se sustentar sob testes independentes, é um lembrete útil de que a pergunta interessante para um firewall, um filtro de fraude ou uma fila de triagem nunca foi "ele consegue escrever uma frase convincente", mas "ele consegue tomar uma decisão da qual consiga se responsabilizar, rápido o suficiente para importar". É essa a pergunta que fazemos sobre o modelo no dispositivo dentro do FireAI toda vez que o alteramos — e é por isso que, para nós, a resposta continua no dispositivo em vez de se tornar uma requisição para a API de outra pessoa.
Onde FireAI e HisnLabs entram nessa história
We have not tested Jev and make no claim it works as described or that FireAI matches it in any way — but the idea that a security decision deserves a small, bounded, fast model instead of a paragraph from a chatbot is one we built FireAI around a year before TypeSafe wrote a blog post about it.
O FireAI é o produto da HisnLabs: um firewall com IA que roda direto no seu Mac. Ele mostra, em linguagem simples, cada conexão que seus aplicativos fazem e deixa você decidir o que sai do seu Mac — a IA roda localmente, então seu tráfego nunca é enviado para nós nem para ninguém. A equipe de pesquisa em segurança da HisnLabs é quem mantém essas decisões confiáveis: cataloga quais domínios são telemetria comum e quais são um serviço de verdade, rastreia o país e a rede por trás de uma conexão e treina o modelo local (o recurso Autopilot) com padrões reais de tráfego, sem que nada disso saia do seu Mac.
Você pode ler as decisões técnicas por trás dele, ou testar o FireAI por 17 dias, em FireAI, da HisnLabs.
