Generado artificialmenteJEV: Hype contra el Reality-Check
Jack Rudenko ha visto una semana de demos de lanzamiento. El modelo es rápido y barato. Las comparaciones son de todos modos las incorrectas.
JEV, el modelo de decisión de TypeSafe AI, salió del stealth el 15 de septiembre de 2026. Jack Rudenko publicó su lectura el 22 de septiembre. Una llamada dura de 70 a 500 milisegundos. La entrada cuesta 0,042 dólares por millón de tokens. La salida no cuesta nada. Con la velocidad no discute. Discute con el oponente.
Casi nadie quería la frase en el hilo.
Jack Rudenko ha visto una semana de demos de lanzamiento y ha escrito la frase que casi nadie quería decir en el hilo: el nuevo modelo es rápido y barato, y la mayoría de las comparaciones son de todos modos las incorrectas.
Su texto se llama Jev: Solving yesterday's problems, faking wins with overengineered demos, and never facing the real competition y apareció el 22 de septiembre de 2026. El feed que describe ha ordenado buzones, marcado mails, reconocido idiomas, evaluado el estado de ánimo y jugado al Pong. Cada clip terminaba en la misma punta: rápido y barato, y un modelo de chat no llega ahí.
Ambas afirmaciones pueden ser ciertas. El oponente en el clip sigue siendo un gran generalista. Esa es toda la queja, y vale la pena leerla despacio, porque bajo los clips se esconde una forma realmente distinta.
Estado adentro. Una decisión tipada afuera. Una llamada.
JEV es el modelo System-One de TypeSafe AI. Le das un estado y una lista de preguntas tipadas. Vuelven decisiones: una elección de una lista, una nota en una escala que tú fijas, o un sí o no con una probabilidad entre 0 y 1. TypeSafe llama a lo último Noul. Todo corre en una llamada. La salida aterriza en el código. Ningún párrafo del que primero tengas que sacar la palabra.
La mecánica, los tres tipos de pregunta y el número de velocidad del fabricante ya están en este sitio: Jev: no un chatbot. Un modelo de decisión. Este texto no reconstruye la página otra vez. Se queda con Rudenko, y con la única prueba externa que le da la razón.
Preguntarle a un generador de texto por la palabra "billing" es el juego equivocado.
La diapositiva corre contra un novelista. El trabajo es una etiqueta.
Cada clip público que ha visto coloca a JEV junto a un modelo de la clase GPT. El propio titular de TypeSafe, tal como él lo reproduce: 193 veces más rápido y 444 veces más barato que el promedio de GPT-6 Astra y Fable 5.1, en cuatro flujos internos. La demo de Pong de Ably: 227 milisegundos por jugada, frente a 2,5 a 3,5 segundos con Haiku, Gemini Flash y GPT-5.6 Sol.
Frente a un generador de texto la brecha es real. Un modelo grande que reparte tickets necesita segundos y cobra cada palabra que escupe. JEV cobra la entrada a 0,042 dólares por millón de tokens y la salida a cero. Las llamadas caen entre 70 y 500 milisegundos. Arize describe la misma etiqueta de precio y la misma ventana de tiempo. El milagro, en estas unidades, no está inventado.
Rudenko considera que el milagro apunta al rival equivocado. La clasificación ya tenía respuestas. Un BERT afinado es el estándar desde 2018, desde que Jacob Devlin y sus coautores publicaron el paper: pequeño, unos 110 millones de parámetros, contento en la CPU de un portátil. Antes, regresión logística sobre conteos de palabras. Antes, expresiones regulares que en routers reales corren más a menudo de lo que admiten las demos.
Si cuentas la red, un BERT aburrido ya está en la sala.
Él quiere la columna que falta en los clips. Para una sola llamada de CPU sitúa un BERT-base sin optimizar en unos 100 milisegundos, uno destilado en unos 60, uno optimizado bajo 10. Los 70 a 500 milisegundos de JEV incluyen el camino a una máquina ajena. El mismo orden de magnitud, a veces más rápido, a veces no. Si metes el modelo local en una GPU de un golpe, el tiempo por pieza según su cuenta cae bajo un milisegundo. Ahí se abre una brecha del factor cien, y se abre hacia la caja que tú ya operas.
En el precio corre el mismo corte. 0,042 dólares por millón de tokens de entrada se ven pequeños junto a Opus. Junto al hardware que tú ya pagas, el modelo local gana a menudo después de configurarlo. Sin recargo por token. Sin desvío por la red. Las cifras de CPU son suyas, no hemos repetido ninguna ejecución. Léelas como su estimación. La dirección es el punto que él fuerza: clasificador contra clasificador.
Un equipo de fuera ha publicado la comparación que él pedía. En paralelo, en un post de Vlad Shulman del 18 de septiembre de 2026, han puesto a JEV a trabajar en tareas que según ellos mismos hacen miles de millones de veces al día. Zero-Shot-Reranking alcanzó un NDCG@10 de 0,7 frente a uno de sus propios rerankers. Clasificación de temas y la pregunta de si una búsqueda necesita resultados frescos: sus modelos ganaron. El coste por documento fue más alto, y dicen por qué: las máquinas en las que corren sus clasificadores les pertenecen. El resumen allí coincide con el suyo. Los titulares de velocidad y precio van contra modelos de chat autorregresivos. Los clasificadores especializados a menudo siguen ganando en ambos.
Sin labels. La pregunta cambia la semana que viene.
Un BERT finamente ajustado no puede responder una pregunta totalmente nueva el jueves sin un bucle de entrenamiento: ejemplos, una pasada, una prueba, un deploy, y el mismo bucle otra vez cuando las labels se mueven. JEV toma la pregunta como cadena de caracteres en el momento de la llamada.
Con eso se describe un verdadero conjunto de jobs. Un router mientras aún no conoces las categorías. Investigación mientras la taxonomía se mueve. Gente que nunca entrenará un modelo. Guardrails para agentes en los que la pregunta cambia de herramienta a herramienta. La propia conclusión de Parallel es la misma regla: si necesitas un clasificador y aún no has entrenado ninguno, empieza aquí y comprueba la calidad con tus ejemplos.
Se baja a la mañana siguiente. El día en que las categorías se fijan y el volumen sube, las labels que JEV acaba de generar son un set de entrenamiento. Tómalas y ajusta un modelo pequeño que te pertenece. La API es el inicio. El camino de operación es el modelo en tu máquina.
Emitir una nota es un formato. Tener razón es un producto.
Las demos mezclan dos frases. JEV emite una nota. La nota es buena. Solo la primera frase se sigue del producto. La segunda es una pregunta aparte, y en esa pregunta lo llama de clase media, como los otros generalistas.
El propio dashboard de TypeSafe, en su lectura: 67,8 por ciento de coincidencia con la referencia sobre sus flujos. Opus 5 en modo workflow llega al 74,1 por ciento. En facturas la brecha se amplía, 61,8 por ciento contra 79,1 por ciento. Le gusta que lo publiquen, y que pongan los factores en el extremo alto de las ganancias reales, en pruebas que escribió su propio equipo.
Una nueva cáscara sobre la misma familia de datos de entrenamiento no hace crecer un gusto nuevo. En MadAppGang le dio a propósito texto descuidado a JEV, Opus 5 y GPT-5.6 Sol y miró cómo cada modelo puntuaba alto. JEV no quedó aparte. «Bueno en puntuar» significa entonces: bueno en emitir un número.
Una fecha en este párrafo no encaja con el resto de su texto. Coloca el test de escritura en mayo de 2024. El launch lo coloca el 15 de septiembre de 2026. Un test en mayo de 2024 no puede haber contenido un modelo que salió del stealth en septiembre de 2026. Lee las notas como su afirmación. Lee el mes como un desliz.
El job que quiere no es el buzón.
Pon una spec al lado de un diff y pregunta qué tan lejos están. Un BERT finamente ajustado no tiene un dataset llamado «tu spec contra tu implementación». Un modelo de chat puede hacerlo en un párrafo que después tienes que desmontar, lento y a precios frontier. JEV puede devolver una nota tipada y una probabilidad en menos de medio segundo, por una fracción de un centavo.
Esa es la forma que quiere en un plato de pruebas. Abajo pruebas sin modelo: diffs de objetos, capturas de pantalla, aprobado o fallado según una regla. Encima un juez que hace un par de preguntas tipadas. ¿Cubre el cambio la spec? ¿Cuánto se ha desviado? ¿Ha entregado algo que la spec nunca pidió? La última pregunta es una prueba de alucinación con una probabilidad en ello. Esa es la pregunta por la que pagaría.
Él mismo nombra los límites. JEV lee texto y JSON. Una prueba de la superficie necesita el DOM, o un modelo de visión que describa ambas pantallas antes de que JEV califique las descripciones. El estado más la pregunta más larga deben caber en 32.000 tokens, así que la unidad es un componente, no un repositorio. La comparación contra Opus 5 en la calidad de implementación no la ha publicado. Esa comparación la llama abierta y dice que la publicará de un modo u otro. Hasta que la página esté ahí, el segundo trabajo es una propuesta con una forma, no un resultado.
Quédate el clip. Pon DistilBERT al lado. O una expresión regular.
Su petición a la gente que publica las demos es pequeña. Quédate los clips. La latencia es real y los clips son el camino por el que una nueva forma se hace visible. Cuando el benchmark sube, se añade una columna: un DistilBERT afinado, o una expresión regular si el trabajo es tan pequeño. Si JEV sigue ganando, has encontrado un uso. Si pierde, te has dado cuenta antes de que una lista de espera se convierta en tu router.
Un modelo que devuelve una decisión en lugar de prosa es la idea correcta. Medirlo con un autor de novelas y luego poner una llamada a la nube donde bastan tres líneas de expresión regular es el error. La clasificación ya tenía una respuesta local. JEV ha resuelto la versión zero-shot y ha abierto un segundo trabajo: calificar un resultado contra una referencia cuando nadie ha construido un set de entrenamiento. Ese segundo trabajo lo considera el que vale un test.
El resto del feed sigue jugando al Pong.
| Afirmación | Cesta | Fuente |
|---|---|---|
| JEV salió del stealth el 15 de septiembre de 2026. TypeSafe AI. Fundada por Diogo Almeida, que trabajó en InstructGPT. | Hecho | Jack Rudenko, 22 de septiembre de 2026. La descripción del producto de Parallel apunta a la misma documentación de TypeSafe. |
| Las llamadas duran de 70 a 500 milisegundos. Entrada 0,042 dólares por millón de tokens. La salida no se cobra. | Hecho, cifras del fabricante | Rudenko. La misma ventana y el mismo precio están en Arize, 18 de septiembre de 2026. |
| 193 veces más rápido y 444 veces más barato que la media de GPT-6 Astra y Fable 5.1, en cuatro flujos internos. | Hecho como línea del fabricante | Rudenko, sobre TypeSafe. Sin repetición desde fuera. |
| Pong a 227 milisegundos por turno, contra 2,5 a 3,5 segundos en Haiku, Gemini Flash y GPT-5.6 Sol. | Hecho como demo descrita | Rudenko sobre la demo de Ably. El video no lo hemos parado después. |
| BERT-base unas 100 ms en una CPU, destilado unas 60, optimizado bajo 10. Un impulso de GPU bajo 1 ms por pieza. | Su estimación | Rudenko. Ninguna ejecución propia en este trozo. Dirección: clasificador local contra la API, en cuanto la red cuenta. |
| Zero-Shot-Reranking en NDCG@10 de 0,7, comparable con un reranker interno. Tema y frescura: modelos internos delante. Costes por documento más altos. | Hecho | Vlad Shulman, Parallel, 18. September 2026. Parallel opera los clasificadores ella misma. |
| Dashboard: JEV 67,8 por ciento en sus flujos, Opus 5 en 74,1 por ciento. Facturas 61,8 contra 79,1. | Informado | La lectura de Rudenko del dashboard de TypeSafe. Una segunda vista del board no la hemos abierto. |
| Un test de escritura en mayo de 2024 ha contenido JEV. | Contradicción | El texto sitúa las notas de MadAppGang en mayo de 2024 y el lanzamiento el 15 de septiembre de 2026. Ambas frases están dentro. Un test no puede describir las dos. |
| Solo texto y JSON. 32.000 tokens. Ninguna comparación publicada sobre la calidad de implementación. | Hecho, como su límite | Rudenko. La comparación con Opus 5 en Spec contra Diff la nombra abiertamente. |
- Jack Rudenko, el texto22. September 2026. La semana de las demos, la lectura del dashboard, el tiempo de Pong, la línea de mayo de 2024, la propuesta Spec contra Diff.https://www.linkedin.com/pulse/jev-solving-yesterdays-problems-faking-wins-demos-never-jack-rudenko-0ss8c/
- Vlad Shulman, Parallel18. September 2026. NDCG@10 de 0,7, tema y frescura, costes por documento, y la frase de que el titular de tempo está contra modelos de chat.https://parallel.ai/blog/testing-jev
- Arize, sobre JEV como juez18. September 2026. La misma ventana de tiempo, el mismo precio de entrada, salida no calculada.https://arize.com/blog/typesafe-jev-llm-judge/
- TypeSafe, introducciónLa propia página del fabricante sobre el modelo de decisión. Parallel la enlaza.https://docs.typesafe.ai/introduction
- Jev: no es un chatbot. Un modelo de decisión.Nuestro explicador, 22 de septiembre de 2026. Choice, Score, Noul, y la cifra de velocidad del fabricante.https://mcgrinsey.com/magazin/jev-entscheidungsmodell-typesafe/
- BERT, Devlin y otros, 2018El paper detrás de la línea «desde 2018». Transformers bidireccionales para la comprensión del lenguaje.https://arxiv.org/abs/1810.04805
Corte: 24 de septiembre de 2026. Los porcentajes del dashboard son la lectura de Rudenko. Los números de Parallel son los de Parallel. La fecha mayo de 2024 permanece en la tabla de hechos, porque el texto la imprime.


