¿Es JEV un agente de IA? Dentro de los modelos "System One" de TypeSafe
Si le mandas un ticket de soporte, Jev, de TypeSafe, no escribe una respuesta. Devuelve un número: 99.9% de probabilidad de que el mensaje sea urgente. Ese cambio — texto generado por una respuesta tipada en milisegundos — es toda la idea detrás de un modelo "System One", y no es lo mismo que un agente de IA.
Jev no es un agente de IA. Es un modelo de decisión "System One": le das una lista fija de respuestas posibles y devuelve una de ellas con una probabilidad calibrada, en una sola pasada rápida, y ahí se detiene — sin conversación, sin llamadas a herramientas, sin un objetivo de varios pasos. TypeSafe dice que es entre 40 y 200 veces más rápido y hasta 444.6 veces más barato que una llamada a un LLM para ese tipo de decisión; pruebas independientes confirman ganancias grandes pero más moderadas. En la práctica, los equipos lo están metiendo dentro de sus agentes como capa de enrutamiento y de barrera de seguridad, no para reemplazar al agente.
Diogo Almeida pasó cuatro años persiguiendo una pregunta. En OpenAI ayudó a construir la investigación sobre seguimiento de instrucciones que terminó siendo ChatGPT [1] — y vio cómo los modelos de lenguaje se volvían sobrehumanos conversando mientras la automatización, lo que las empresas de verdad querían, seguía siendo tercamente difícil. El 15 de septiembre de 2026, su startup, TypeSafe AI, lanzó lo que él considera la mitad que faltaba: un modelo "System One", llamado así por el pensamiento rápido e intuitivo del "Sistema 1" de Daniel Kahneman [1]. Su primer modelo público se llama Jev — en honor a William Stanley Jevons, apostando a que una inteligencia más barata genera más demanda, no menos [1].
Jev no genera texto. Si le envías un "estado" — un párrafo, un ticket de soporte, un tablero de juego — junto con un conjunto de preguntas tipadas, devuelve respuestas tipadas con probabilidades calibradas, en una sola pasada paralela en lugar de un token a la vez [1][2]. La documentación de TypeSafe define tres tipos de pregunta: Choice elige entre una lista fija ("¿qué equipo debería atender este ticket?"), Score puntúa algo en una escala ordenada ("¿qué tan frustrado está este cliente?"), y Noul responde sí o no con una probabilidad ("¿este mensaje pide un reembolso?") [2]. La forma de cada respuesta está fijada de antemano — en palabras de TypeSafe, el resultado es "una llamada a función de inteligencia de frontera: entra un estado no estructurado, salen decisiones probabilísticas tipadas" [1].
Un modelo que se niega a escribir una frase resulta ser justo lo que necesitaba una decisión de enrutamiento.
Las cifras, revisadas dos veces
La comparación que TypeSafe publica sitúa los tokens de entrada de Jev en 0.042 dólares por millón — 42 dólares por cada mil millones — frente a entre 0.20 y 10 dólares en los LLM con los que se compara, con la salida gratis porque no hay texto que cobrar [1]. En velocidad, sus evaluaciones de flujos de trabajo afirman respuestas de 70 a 500 milisegundos frente a 3 a 329 segundos de punta a punta en los LLM de frontera, y la cifra de "193.6 veces más rápido, 444.6 veces más barato" de su página principal viene de una sola corrida registrada: 0.000081 dólares y 0.114 segundos para Jev frente a 0.013880 dólares y 8.566 segundos para el modelo de comparación [7]. La propia TypeSafe señala el sesgo: sus respuestas de referencia son el promedio de dos modelos de OpenAI y Anthropic, y admite sin rodeos que sus cifras publicadas están "en el extremo alto de las ganancias reales" [1].
Dos verificaciones externas, ambas publicadas dentro de la semana del lanzamiento, aterrizan más cerca de la tierra. El equipo de ingeniería de liteLLM puso a Jev a competir contra Claude Haiku 4.5 como clasificador de solicitudes dentro de su propia puerta de enlace de IA: en 240 llamadas, el tiempo mediano de clasificación de Jev fue de 126.81 ms frente a 688.40 ms de Haiku — 5.43 veces más rápido — con un costo, según precios de catálogo, 96.1% menor, y acertó las etiquetas de enrutamiento que el propio equipo escribió en el 95% de las llamadas, frente a 73.75% de Haiku [4]. LiteLLM es directo sobre el techo de esa cifra: las etiquetas las redactó el mismo equipo sin revisión independiente, sobre un corpus de 80 mensajes sintéticos, y el resultado "no establece la precisión general de clasificación ni la calidad de las respuestas finales" [4].
Una segunda comprobación, más artesanal, vino de un desarrollador independiente, Akshay Kanthed, que construyó una herramienta que escanea un repositorio en busca de llamadas a LLM que en realidad solo hacen enrutamiento o clasificación, y luego mide cuánto se ahorraría al convertirlas [5]. Contra la API real de OpenAI, en tres casos de prueba reales, una regla local escrita a mano venció a una llamada a GPT-4o-mini por entre 1,240 y 12,483 veces en latencia, con un costo prácticamente nulo [5]. Él mismo aclara que la comparación es ilustrativa, no definitiva: la "regla local" solo sustituye a Jev para mostrar la forma del ahorro, "no es garantía de que tu decisión concreta se generalice tan limpiamente" [5].
Dónde encaja de verdad
Nada de esto convierte a Jev en un reemplazo de un agente — TypeSafe no lo afirma, y tampoco quien lo ha puesto a prueba. El artículo de LangChain es directo: "Jev no es un reemplazo directo de un LLM... Eso lo convierte en un complemento prometedor del modelo que impulsa tu agente: usa un LLM para el razonamiento abierto y la generación, y Jev para las decisiones estructuradas y rápidas por el camino" [6]. Su integración ofrece dos patrones concretos: un middleware de enrutamiento de modelos que hace que Jev elija un modelo barato o uno potente para cada solicitud antes de que el agente empiece, y un middleware de "modo automático" que hace que Jev examine una llamada a herramienta riesgosa — un comando bash, por ejemplo — antes de permitir que se ejecute [6].
Un artículo de investigación publicado la misma semana va más allá y usa un modelo System One como capa de control para todo el sistema de memoria de un agente, en lugar de para una sola decisión. Jev-Mem divide el trabajo en un plano rápido de "System One" que se encarga de tipar la memoria, enrutar las búsquedas y decidir cuándo detenerse, y un plano más lento de "System Two" — un LLM — que solo se invoca para el razonamiento final y la respuesta [3]. En el benchmark LoCoMo, esa división redujo el tiempo de construcción de la memoria a 158 segundos — 6.6 veces más rápido que el sistema competidor más veloz con el que se comparó — y la latencia media de consulta a 0.93 segundos, una reducción del 36.7%, mientras que su puntuación de calidad de respuesta subió 11.0% sobre la mejor referencia [3]. El patrón se repite en los tres ejemplos: Jev se coloca delante o al lado del modelo de razonamiento, decidiendo qué pasa después. El razonamiento en sí no lo hace él.
Lo que se queda fuera de "cero alucinaciones"
La afirmación más atrevida de TypeSafe es que Jev no puede alucinar, y bajo una definición muy estrecha eso es cierto: como cada respuesta tiene que ajustarse a un esquema declarado de antemano, un error de tipo es "matemáticamente imposible" en lugar de empíricamente raro [1]. La propia documentación de TypeSafe es más cautelosa sobre lo que eso garantiza: la calibración "se mide a través de grupos de predicciones; no garantiza que una respuesta individual sea correcta" [2]. Una respuesta tipada equivocada pero segura de sí misma — la forma correcta, el valor incorrecto — sigue siendo posible. Lo que Jev elimina es la posibilidad de que una respuesta mal formada rompa tu código más adelante, no la posibilidad de una decisión equivocada.
Entonces, ¿es un agente de IA?
Según la definición de este sitio, no. Un agente de IA decide su propio siguiente paso a lo largo de una secuencia de acciones; Jev responde una pregunta tipada y se detiene. No mantiene una conversación, no llama herramientas por su cuenta ni persigue un objetivo a lo largo de varios turnos. Es un componente que otros sistemas — agentes incluidos — pueden invocar cuando necesitan una respuesta rápida, barata y estructurada en lugar de una escrita. Que te sea más útil que el LLM que ya vive dentro de tu agente depende de cuánto de lo que hace ese agente es, en realidad, elegir entre una lista corta de opciones — que, según las tres pruebas anteriores, es más de lo que la mayoría de los equipos ha medido.

Fuentes
- TypeSafe AI — "Introducing System One Models & Jev" (blog oficial, 15 de septiembre de 2026)
- TypeSafe AI — Documentación: "System One" (docs.typesafe.ai/concepts/system-one)
- Jiang, Li y Li — "Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents", arXiv:2609.23986 (21 de septiembre de 2026)
- liteLLM — "JEV Classifier: 5.43x as Fast as Haiku, 96% Lower Cost" (prueba de referencia, 20 de septiembre de 2026)
- Akshay Kanthed, DEV Community — "I stopped believing '99% cost reduction' claims, so I benchmarked my own tool instead" (21 de septiembre de 2026)
- LangChain — "Building a Harness with Jev" (17 de septiembre de 2026)
- TypeSafe AI — página principal (typesafe.ai), cifras de costo y latencia de los flujos de trabajo
Preguntas frecuentes
¿Es Jev un agente de IA?
No. Jev es un modelo de decisión "System One": responde una pregunta tipada a la vez — una elección, una puntuación o un sí/no — a partir de un conjunto fijo de respuestas posibles, y se detiene ahí. No mantiene una conversación, no llama herramientas por su cuenta ni persigue un objetivo de varios pasos, que es justamente lo que define a un agente en este sitio. Normalmente se usa como un componente dentro del flujo de un agente, no como su reemplazo.
¿Es Jev realmente libre de alucinaciones?
Tiene garantizado que nunca devolverá una respuesta fuera de su esquema declarado — TypeSafe lo llama matemáticamente imposible, no empíricamente raro. Eso es distinto de ser correcto: la propia documentación de TypeSafe señala que una respuesta segura y con el tipo correcto puede seguir siendo errónea, ya que la calibración se mide sobre grupos de predicciones, no se garantiza para ninguna respuesta individual.
¿Cuánto más rápido y más barato es que una llamada normal a un LLM?
Las propias evaluaciones de flujos de trabajo de TypeSafe afirman entre 40 y 200 veces más rápido con una inteligencia similar para este tipo de tarea, y hasta 444.6 veces más barato. Las pruebas independientes dan cifras menores pero igualmente grandes: liteLLM midió que la latencia mediana de clasificación de Jev era 5.43 veces más rápida que la de Claude Haiku 4.5, con un costo alrededor de 96% menor, en una prueba de 80 mensajes que los propios autores describen como acotada y escrita por ellos mismos en vez de revisada de forma independiente.