Generado artificialmenteJev: no es un chatbot. Un modelo de decisión.
State entra, probabilidades tipadas salen. La parte cara del bucle de llamadas LLM desaparece.
Jev no es otra chat-IA. Es una nueva clase de modelo que no escribe frases. En lugar de texto entrega decisiones tipadas: una categoría, un score, una probabilidad sí/no, más un número de confidence al que tu código puede reaccionar de inmediato. Inicio: 15. septiembre 2026. Empresa: TypeSafe AI. Seed: 40 millones de dólares, lead DCVC. El nombre hace un guiño al economista William Stanley Jevons: si algo se vuelve masivamente más barato, la gente consume mucho más de ello.
Ningún chatbot. Ningún parser en el medio. Decisiones tipadas.
Tú envías State y Questions. Jev responde en un pase paralelo con valores estructurados, no con prosa.
State es un string, un objeto JSON o un array de texto: ticket de soporte, email, ficha de cliente, game-snapshot. Questions son una o varias preguntas tipadas sobre este State. Jev responde todas en un solo pase.
TypeSafe AI está en San Francisco, fundada en 2024 por Diogo Almeida (CEO), Erik Gafni y Sasha Sheng. Almeida estuvo alrededor de cuatro años en OpenAI en RLHF, InstructGPT, ChatGPT y GPT-4, antes de construir algo que los ordenadores pueden consumir sin un parser en el medio. El 15. septiembre 2026 salió jev-1.13.0 (jev-latest). Además 40 millones de dólares de seed, lead DCVC.
TypeSafe lo llama un modelo System One, según el System 1 rápido e intuitivo de Daniel Kahneman. Los modelos de chat están más cerca del System 2: lentos, verbales, deliberativos. Jev está construido para los mil pequeños juicios que el software de todos modos toma cada segundo: enrutar tickets, marcar mensajes, puntuar leads.
Choice, Score, Noul. Esquema fijo. Ninguna cuarta categoría.
Una opción de una lista
Hasta 255 opciones. Devuelve: ganador, probabilidad por opción, confidence.
Evaluación según tu rúbrica
State según una escala ordenada que tú defines. No es una puntuación de texto libre.
Bernoulli / Sí-No
El nombre de TypeSafe para la pregunta sí/no. Probabilidad entre 0 y 1 de que la afirmación sea verdadera.
Porque el esquema de output está fijado de antemano, Jev no puede inventar una cuarta categoría ni envolver la respuesta en un párrafo. La alucinación en el sentido habitual de LLM queda fuera a nivel estructural. La incertidumbre está en un número.
$0,042 por millón de tokens de input. Output gratis. A menudo por debajo de medio segundo.
$42 / 1B
Output-Tokens
Rate limits según la spec: 250.000 tokens/segundo, 1.200 requests/minuto. Input solo texto. En las propias evals de workflow de TypeSafe, Jev quedó en 67,8 % de accuracy a la par con Claude Sonnet 5, a $0,0004 por case frente a $0,1174 y 0,4 segundos frente a 78 segundos. Son cifras del vendor en el extremo alto de lo que tú deberías esperar en la naturaleza.
Los early testers independientes fueron menos dramáticos, pero en la misma dirección. Un engineer de Vercel reemplazó un clasificador de OpenAI y vio 5-18× más rápido. Un CTO de Bryo-AI encontró a Gemini un poco más preciso en clasificación de email, pero Jev 10-20× más barato y las probability scores reales más útiles para la automatización. La demanda tras el launch fue lo bastante alta como para que TypeSafe no pudiera atender la API un rato.
Solo datos sintéticos. RLCD en lugar de RLHF.
Almeida dice: Jev se entrenó solo con datos sintéticos, con un método llamado Reinforcement Learning for Calibrated Decisions (RLCD). El objetivo no es «escribe texto que a la gente le guste» (RLHF). El objetivo es: asignar probabilidades de modo que coincidan con la frecuencia con la que esa decisión es realmente correcta. Él considera la apuesta por los datos sintéticos mejor que el propio RLHF.
Arquitectura: basada en transformer. Pesos y paper: no publicados. Desde fuera se sospecha un LLM open weight debajo con otro sampler y otro objetivo de entrenamiento. Sin confirmar.
AI-native if. No Claude Code. No Cursor.
Código clásico: flaggear cada transferencia sobre $10.000. Jev: leer todo el contexto, „suspicious, 0.91“ en unos pocos cientos de milisegundos.
Buenos fits: Enrutamiento de tickets y emails. Clasificación de safety y policy. Lead-scoring y prioridad. Model-routing (first-pass barato, LLM caro solo con confidence baja). Loops en tiempo real en games, agents y tools. Cada „AI-native if“ que antes costaba una chat-completion completa.
No fit: Escribir emails, código o explicaciones. Chat abierto. Imágenes, audio, video (por ahora solo texto). Sustituto drop-in de Claude Code, Cursor o Copilot. Siguen necesitando un modelo generativo. Jev se sienta debajo como capa de decisión.
Engineer Paarangat Rai tiene la forma corta más limpia: Jev es un AI-native if.
Cuatro años de optimización en lenguaje humano. La automation se quedó cara y frágil.
Generate text, parse JSON, retry cuando el schema se rompe, esperar que el modelo no invente un campo. Ese era el stack.
Jev da la vuelta a la interfaz. State no estructurado entra, decisiones probabilísticas tipadas salen. La parte cara de un LLM-call, samplear token por token, desaparece. El output es gratis, porque casi no hay output.
Eso no hace a Jev „más listo que GPT“. Hace otra forma de inteligencia lo bastante barata para el bucle interno del software. El pitch de Almeida no es AGI. Es inteligencia componible y machine-native que otros programas pueden apilar.
Vendor-evals. La calibración es una propiedad de grupo. El inglés es el más fuerte.
- Los claims de accuracy siguen apoyándose mucho en vendor-evals. Los checks de terceros son alentadores en cost y latency, mixed-to-good en accuracy cruda.
- La calibración es una propiedad de grupo. 0,87 no es una garantía para el caso individual.
- Las respuestas de low-confidence siguen necesitando a un humano o un modelo más grande. Jev empuja el problema de alucinaciones a un número que tú tienes que thresholdear.
- El inglés es el más fuerte. Otros idiomas funcionan, con accuracy más baja.
- Proprietary y hosted. Sin weights locales.
Una semana después del launch Jev es menos una curiosidad de investigación que un nuevo primitivo. Los modelos de chat seguirán escribiendo. Los modelos de decisión empiezan a decidir, al precio y a la latency de un function call.
| Afirmación | Cesta | Fuente |
|---|---|---|
| Launch jev-1.13.0 / jev-latest el 15 de septiembre de 2026 | Hecho, Vendor | TypeSafe AI material de launch, estado de la nota |
| TypeSafe AI: Diogo Almeida (CEO), Erik Gafni, Sasha Sheng; SF; fundado en 2024 | Hecho, Vendor | Datos de empresa y lanzamiento |
| $40M Seed, Lead DCVC | Hecho, Vendor | Anuncio de seed de TypeSafe |
| Input $0,042 / 1M Tokens, Output gratis, Latency 70-500 ms, Context 64k | Hecho, Spec | Specs oficiales jev-1.13.0 |
| Rate limit 250k Tokens/s, 1.200 RPM | Hecho, Spec | Specs oficiales |
| 67,8 % Accuracy a la par con Claude Sonnet 5; $0,0004 vs $0,1174; 0,4 s vs 78 s | Vendor-Eval | TypeSafe Workflow-Evals, autoinformado |
| Peak 193,6× más rápido, 444,6× más barato | Vendor-Peak | TypeSafe, extremo superior de la expectativa |
| Vercel: 5-18× más rápido vs OpenAI-Classifier | Early Tester | Informe independiente, Early Access |
| Bryo AI: Gemini un poco más preciso, Jev 10-20× más barato, Probability-Scores más útiles | Early Tester | CTO-Feedback, Early Access |
| Training: solo datos sintéticos, RLCD; sin Weights públicos | Declaración del vendor | Almeida / TypeSafe |
| Tres primitivas: Choice, Score, Noul | Producto | Modelo de API de TypeSafe |
- TypeSafe AI / Jev LaunchProducto, Specs jev-1.13.0, Seed, Primitive, System-One-Framing.https://typesafe.ai/
- William Stanley JevonsEpónimo: si algo se vuelve más barato, sube el consumo.https://en.wikipedia.org/wiki/William_Stanley_Jevons
- Daniel Kahneman, Thinking, Fast and SlowSystem 1 / System 2 como framing para el System One model de TypeSafe.https://en.wikipedia.org/wiki/Thinking,_Fast_and_Slow
- OpenAI: RLHF / línea InstructGPTTrasfondo Almeida (RLHF, InstructGPT, ChatGPT, GPT-4) antes de TypeSafe.https://openai.com/index/instruction-following/
Jev: no es un chatbot. Un modelo de decisión. 22 de septiembre de 2026. McGrinsey Writing Skill. Vendor-Evals marcados como Vendor-Evals. Informes de early testers como Early Access.


