El blog de seguridad de FireAI

Por FireAI Security & Research Team · Publicado

Jev y el auge de los modelos de decisión: qué significa System One AI para las herramientas de seguridad

Jev y el auge de los modelos de decisión: qué significa System One AI para las herramientas de seguridad

El 25 de septiembre de 2026, TypeSafe AI anunció Jev, el primer modelo en lo que llama la categoría "System One": no un chatbot, ni simplemente un modelo de lenguaje más grande, sino lo que la compañía describe como un modelo de decisión: algo creado para responder una pregunta limitada con una respuesta calibrada y escrita en lugar de un párrafo de prosa. El anuncio está lleno de cifras específicas, por lo que este artículo lo analiza exactamente como se afirma, marca claramente lo que pudimos y no pudimos verificar, y analiza por qué vale la pena tomar en serio la idea subyacente, decidir en lugar de generar, para el software de seguridad en particular.

Lo que realmente anunció TypeSafe

TypeSafe AI fue fundada por Diogo Almeida, quien escribe en el anuncio que "En OpenAI, ayudé a crear los métodos que hicieron que los modelos de lenguaje fueran útiles para seguir instrucciones y hablar con la gente". Jev, llamado el "primer modelo público" de la compañía, se presenta como un trabajo completamente diferente: producir lo que TypeSafe llama valores estructurados de tipo seguro con probabilidades calibradas y puntajes de confianza, generados a través de lo que llama un muestreador paralelo en lugar de la habitual decodificación token por token, y entrenado con un método que la compañía llama Aprendizaje por refuerzo para decisiones calibradas, o RLCD.

  • TypeSafe informa un tiempo de respuesta de extremo a extremo de "70 ms-500 ms", frente a lo que midió como "3 a 329 segundos" para los modelos de lenguaje fronterizo con los que comparó a Jev.
  • TypeSafe valora los tokens de entrada en "$0,042 / MTok", y los tokens de salida figuran como gratuitos.
  • En sus propias evaluaciones de flujo de trabajo, TypeSafe informa que Jev funciona "193,6 veces más rápido, 444,6 veces más barato" que las políticas con las que se midió.
  • TypeSafe describe un error de tipo en la salida de Jev como, en sus propias palabras, "matemáticamente imposible".
  • Jev está en acceso temprano; TypeSafe dice que está sacando a los desarrolladores "de la lista de espera lo más rápido posible".

Generación versus decisión

Una gran parte de lo que se llama "IA en producción" no es en absoluto una tarea de escritura. Permitir o bloquear una conexión. Escalar o cerrar un ticket. Marcar o borrar una transacción. Enrutar un mensaje a una cola u otra. El resultado deseado no es prosa, es una etiqueta extraída de una lista corta y fija, a veces con una partitura adjunta. Ejecutar ese tipo de preguntas a través de un modelo creado para producir párrafos fluidos es una falta de coincidencia: regresa un blob JSON que debe ser analizado y se espera que sea válido, y cualquier confianza declarada tiende a significar poco en particular, porque nada lo obligó a rastrear la tasa de error real del modelo.

Vale la pena separar aquí dos afirmaciones, porque no son lo mismo: mecanografiado y calibrado. Una salida escrita limita la forma de la respuesta: una pregunta de "elección" devuelve una de las opciones de la lista, una "puntuación" devuelve un número dentro de un rango declarado, nunca una frase perdida o un campo inventado. La calibración es una idea mucho más antigua y completamente separada. Es una propiedad estadística, no estilística: significa que cuando el sistema establece una probabilidad de 0,62, a menudo tiene razón en muchas predicciones similares, por lo que un programa posterior puede establecer un umbral en ese número en lugar de tratarlo como decoración.

La propia denominación de TypeSafe toma prestado su vocabulario de la psicología más que de la estadística. Daniel Kahneman, que recibió el Premio Nobel de Ciencias Económicas en 2002 "por haber integrado conocimientos de la investigación psicológica en la ciencia económica, especialmente en lo que respecta al juicio humano y la toma de decisiones en condiciones de incertidumbre", popularizó los términos en Pensar, rápido y lento: "El Sistema 1" es "rápido, automático, frecuente, emocional, estereotipado, inconsciente", mientras que el "Sistema 2" es "lento, esforzado, infrecuente, lógico, calculador, consciente". La metáfora es evocadora, pero describe la cognición humana, no una garantía sobre un software. Un modelo puede ser rápido de la misma manera que el Sistema 1 es rápido, sin que su confianza declarada signifique nada en absoluto: la calibración debe ganarse y medirse, no implicarse en un nombre.

Lo que puede y no puede significar "no puedo alucinar"

La afirmación de TypeSafe de que un error de tipo es "matemáticamente imposible" describe la decodificación restringida, una técnica que ya existe en otros lugares. La propia guía de Salidas Estructuradas de OpenAI ofrece una garantía similar: la característica, dice, "garantiza que el modelo siempre generará respuestas que se adhieran al esquema JSON proporcionado, por lo que no necesita preocuparse de que el modelo omita una clave requerida o alucine con un valor de enumeración no válido". Esa garantía es real y útil. También es más limitado de lo que parece: limita la forma de la respuesta, no si la respuesta es correcta. Una pregunta de "elección" con tres opciones siempre devolverá una de las tres, incluida, si el modelo ha juzgado mal la entrada, una respuesta incorrecta, segura y válidamente escrita.

La calibración es la pieza que hay que comprobar, no afirmar. La herramienta estándar es un diagrama de confiabilidad: predicciones de grupos según su confianza declarada, y para cada grupo, gráfico con qué frecuencia esas predicciones resultaron ser correctas; la brecha entre la diagonal y la línea observada generalmente se resume como error de calibración esperado. Esta no es una pregunta nueva para el aprendizaje automático: Artículo de Guo et al. de 2017 "Sobre la calibración de redes neuronales modernas" descubrió que "las redes neuronales modernas... están mal calibradas" de forma predeterminada, y que una solución simple de un solo parámetro llamada escala de temperatura fue "sorprendentemente efectiva" para repararla. La lección se generaliza más allá de ese artículo: la calibración no es una propiedad que un modelo pueda anunciar sobre sí mismo. Es algo que usted verifica, en sus propios datos etiquetados, porque tiende a degradarse exactamente donde más lo necesita: en entradas que no se parecen en nada al modelo en el que se sintonizó.

Un arnés de evaluación mínimo (plantilla)

Antes de encaminar una decisión real a través de cualquier modelo de decisión, Jev o no, tres preguntas importan más que cualquier cifra del proveedor: ¿la respuesta escrita se compara con su esquema cada vez? El siguiente boceto es una plantilla construida alrededor de la forma de solicitud que se muestra en la documentación de inicio rápido de TypeSafe. No hace ninguna afirmación sobre lo que mostraría ejecutarlo contra Jev; no lo hemos ejecutado y este es un pseudocódigo ilustrativo, no un informe.

calibración_check.py: solo plantilla, no ejecutada contra Jev
# Illustrative pseudo-code. Mirrors the request shape shown in TypeSafe's own
# quickstart docs (POST /v1/systemone with state, model, and typed questions).
# Not run against Jev or any live API; no results are claimed here.
import requests

def ask(state: str, question_id: str, question: dict) -> dict:
    resp = requests.post(
        "https://api.typesafe.ai/v1/systemone",
        headers={"Authorization": f"Bearer {API_KEY}"},
        json={"state": state, "model": "jev-latest", "questions": {question_id: question}},
    )
    return resp.json()["answers"][question_id]

# 1. Shape check: does every response parse against the declared type, on your
#    own edge cases, not just a vendor demo set?
# 2. Calibration check: bucket the stated confidence and compare it to the
#    true label rate, on data the model has never seen.
buckets = {i: {"n": 0, "correct": 0} for i in range(10)}
for state, true_label in labeled_sample:          # your own traffic, labeled by hand
    answer = ask(state, "decision", {"type": "noul", "instructions": "Should this be allowed?"})
    bucket = min(int(answer["noul"] * 10), 9)
    buckets[bucket]["n"] += 1
    buckets[bucket]["correct"] += int(round(answer["noul"]) == true_label)

for b, s in buckets.items():
    if s["n"]:
        stated = (b + 0.5) / 10
        observed = s["correct"] / s["n"]
        print(f"stated~{stated:.2f}  observed={observed:.2f}  n={s['n']}")  # the gap here is your calibration error
  • Si la respuesta escrita siempre se analiza, en las entradas que produce su propio sistema, no solo en el conjunto de demostración de un proveedor.
  • Si un 0,9 declarado es correcto aproximadamente nueve de cada diez veces en su propio tráfico etiquetado, no en el conjunto de evaluación de otra persona.
  • Si esa calibración se mantiene en entradas diferentes a todo lo que se haya visto antes: una nueva aplicación, un nuevo protocolo, un remitente que ha leído el mismo anuncio que usted acaba de leer.
  • Lo que hace la persona que llama en un tiempo de espera o una interrupción, ya que un sistema de decisión necesita un valor predeterminado seguro cuando el modelo de decisión es inalcanzable.

Por qué esto es importante para las herramientas de seguridad

Un firewall, un filtro de spam, una verificación de fraude, una cola de clasificación: cada uno de ellos es un sistema de decisión que responde la misma forma de pregunta una y otra vez: dada esta entrada, permítala o bloquéela, con cuánta confianza y dónde se encuentra el umbral. La propia página de evaluaciones de TypeSafe extrae sus ejemplos exactamente de este territorio: juzgar si cerrar una alerta de seguridad, escalarla a una persona o contenerla inmediatamente es una decisión de clasificación, no una tarea de escritura, y es el tipo de llamada que una herramienta de seguridad hace constantemente, en un volumen que ningún analista podría revisar manualmente.

Comparación ilustrativa, no una transcripción de ningún sistema real.
Respuesta generativa de LLMDecisión escrita (estilo Jev)
ProducciónUn párrafo que explica la conexión a una dirección desconocida en un puerto poco común "podría valer la pena revisarlo"{permitir: falso, confianza: 0,81}
AnalizandoRegex, o una segunda llamada de modelo, para sacar una acción de la prosaGarantizado para coincidir con el esquema declarado
UmbralNo hay confianza numérica para comparar con una pólizaUn valor de confianza que una persona que llama puede establecer un umbral directamente
Modo de fallaFluido, plausible y a veces simplemente erróneoIncorrecto con un número adjunto, que al menos una verificación de calibración puede detectar en promedio

Honestamente, la compensación por la privacidad

Jev, como lo describe TypeSafe, es una API alojada: una solicitud transporta "estado", es decir, cualquier dato sobre el que se trate la pregunta, a los servidores de TypeSafe a través de Internet. Para los ejemplos de incidentes de seguridad y clasificación que el propio TypeSafe destaca, ese estado es exactamente el tipo de información que muchas personas preferirían no entregar a un tercero de forma predeterminada: qué aplicación está hablando con qué dirección, con qué frecuencia y desde qué dispositivo. Enviarlos a cualquier modelo de nube, por rápido o barato que sea, significa que los datos salen de la máquina de donde provienen.

FireAI, el firewall macOS propio de HisnLabs, tomó la decisión opuesta para la categoría exacta de decisión de la que trata este artículo. FireAI se ejecuta en macOS 14 o posterior en Apple Silicon, por un precio único de 49 €, y explícitamente no es un antivirus ni una VPN. Cuando una aplicación que no has visto antes intenta acceder a la red, FireAI puede ejecutar un modelo pequeño en el propio dispositivo (una descarga opcional de 1,5 GB) para revisar esa conexión y avisarte con un motivo adjunto en lenguaje sencillo; el tráfico que se revisa nunca se envía a ninguna parte. Cada una de esas decisiones asistidas por IA se convierte en una regla visible, vinculada a la firma del código de la aplicación, que puede ver y deshacer, junto con fuentes de amenazas que se aplican localmente en lugar de consultarse en un servidor remoto.

No afirmamos que el modelo en el dispositivo de FireAI coincida con Jev, ni con ningún otro modelo de sistema, en términos de corrección, velocidad o precio; no hemos realizado esa comparación y no tenemos evaluaciones propias para publicar aquí. Lo que sí respalda este anuncio es una dirección de diseño: que una decisión de seguridad se cumple con un modelo pequeño, rápido y limitado que se ejecuta cerca de los datos, en lugar de enrutarlos a través de un chatbot de propósito general en otro lugar. TypeSafe está defendiendo ese caso desde el lado de la API; FireAI ya se basa en él desde el lado del dispositivo, y por una razón diferente: porque para un firewall específicamente, los datos en cuestión no deberían tener que salir de la máquina para ser juzgados en absoluto.

Preguntas abiertas

  • Evaluaciones independientes: ninguna parte externa ha publicado aún una reproducción de los múltiplos de velocidad o costo en el anuncio de TypeSafe, sobre datos que TypeSafe no eligió.
  • Calibración bajo cambio de distribución: el escenario exacto del que trata el artículo de Guo et al., y el que más importa contra un adversario que se adapta una vez que un método de defensa es público.
  • Si el precio se mantiene en el volumen de producción real y si la latencia indicada se mantiene bajo una carga sostenida en lugar de una única solicitud demostrada.
  • Cómo se comporta el modelo ante entradas contradictorias o genuinamente ambiguas, donde una respuesta escrita con confianza puede ser menos honesta que una respuesta que diga "poco claro".
  • Cuándo se abre el acceso anticipado más allá de la lista de espera, a quién y bajo qué términos para los datos enviados como "estado".

Por ahora, Jev es un conjunto de afirmaciones de un equipo con credenciales reales y aún sin verificación externa. La categoría que intenta nombrar, modelos de decisión en lugar de modelos de generación, señala una brecha real en cómo se ha creado hasta ahora el software de seguridad para utilizar la IA. Independientemente de si Jev resiste o no las pruebas independientes, es un recordatorio útil de que la pregunta interesante para un firewall, un filtro de fraude o una cola de clasificación nunca fue "¿puede escribir una oración convincente?" sino "¿puede tomar una decisión que pueda respaldar, lo suficientemente rápido como para importar?". Esa es la pregunta que nos hacemos sobre el modelo en el dispositivo dentro de FuegoAI cada vez que lo cambiamos, y es por eso que, para nosotros, la respuesta permanece en el dispositivo en lugar de convertirse en una solicitud a la API de otra persona.

Dónde entran FireAI y HisnLabs

We have not tested Jev and make no claim it works as described or that FireAI matches it in any way — but the idea that a security decision deserves a small, bounded, fast model instead of a paragraph from a chatbot is one we built FireAI around a year before TypeSafe wrote a blog post about it.

FireAI es el producto de HisnLabs: un firewall con IA que corre directamente en tu Mac. Te muestra, en lenguaje claro, cada conexión que hacen tus aplicaciones y te deja decidir qué sale de tu Mac; su IA funciona de manera local, así que tu tráfico nunca se envía a nosotros ni a nadie más. El equipo de investigación en seguridad de HisnLabs es el que mantiene esas decisiones confiables: cataloga qué dominios son simple telemetría y cuáles un servicio real, rastrea el país y la red detrás de cada conexión, y entrena el modelo local (la función Autopilot) con patrones de tráfico reales, sin que nada de eso salga de tu Mac.

Puedes leer las decisiones técnicas detrás de FireAI, o probarlo durante 17 días, en FireAI, de HisnLabs.

Fuentes