Hoy abrimos yoDEV Decisions, una herramienta gratuita para miembros de yoDEV que ejecuta la misma pregunta en Jev y en el LLM que elijas, fila por fila, y compara los resultados: exactitud, calibración, costo y latencia.
La idea surgió de nuestro artículo sobre Jev de TypeSafe. Allí concluimos que las cifras de un proveedor no sustituyen una medición propia y que los equipos de Iberoamérica necesitan medir con sus datos, en su idioma. Decisions es esa medición.
yoDEV cubre las llamadas a Jev. Para el lado del LLM conectas tu propia cuenta de OpenRouter.
¿Qué muestran los primeros resultados?
Para los resultados públicos elegimos cuatro LLM populares (GPT-4o mini, Gemini 2.5 Flash, Claude Haiku 4.5 y Llama 3.3 70B) y cuatro conjuntos de datos públicos, de 200 filas cada uno, con la pregunta formulada en español. Con tus propios datos puedes comparar Jev con cualquier modelo disponible en OpenRouter, incluidos modelos gratuitos.
| Conjunto | Tarea | Jev | Mejor LLM |
|---|---|---|---|
| Banking77 | Intención de un cliente bancario, entre 77 opciones | 82,0 % | 84,0 % (Gemini 2.5 Flash) |
| SMS spam | ¿Es spam? | 97,0 % | 98,0 % (Gemini 2.5 Flash) |
| Moderación en español | ¿Es ofensivo? | 98,0 % | 98,5 % (GPT-4o mini y Llama 3.3 70B) |
| Sentimiento en español | Positivo, neutral o negativo | 66,0 % | 75,0 % (Gemini 2.5 Flash) |
Tres observaciones:
- Latencia: Jev respondió con una mediana de unos 250 ms en los cuatro conjuntos. Los cuatro LLM tardaron entre 1 y 2,3 segundos.
- Costo: Jev fue el más barato en los cuatro conjuntos. En Banking77 costó unos 0,08 USD por cada 1.000 filas, frente a 0,28 USD de Gemini 2.5 Flash y 1,84 USD de Claude Haiku 4.5.
- Exactitud: Jev no gana en todo. En clasificación de intención, spam y moderación queda a dos puntos o menos del mejor LLM, e incluso por delante de algunos. En sentimiento en español queda nueve puntos por detrás.
Ese último resultado es la razón de ser de la herramienta: un promedio no te dice cómo se comporta un modelo en tu tarea.
¿Qué pasa si combinas Jev con un LLM?
Decisions también calcula una estrategia combinada: Jev responde cuando su confianza supera un umbral y el resto de filas pasa al LLM. La herramienta recomienda ese umbral a partir de los datos.
En sentimiento en español, esa combinación alcanzó un 74,5 % de exactitud enviando a Gemini solo el 40,5 % de las filas. Obtienes casi la exactitud del LLM, con Jev resolviendo la mayoría de las filas a su velocidad y su costo.
¿Cómo lo pruebo con mis datos?
- Inicia sesión en decisions.yodev.dev con tu cuenta de yoDEV. Si aún no tienes una, el registro es gratuito.
- Conecta OpenRouter para el lado del LLM y elige cualquiera de sus modelos. Pagas esas llamadas con tu propio saldo, o eliges un modelo gratuito. Tu clave de OpenRouter se guarda en tu navegador.
-
Elige un conjunto predefinido o sube un CSV con una columna
texty una columnalabelcon la respuesta esperada: hasta 2.000 filas. - Revisa los resultados: exactitud, calibración, costo, latencia, las filas en las que los modelos no coinciden y la estrategia combinada recomendada. Cada ejecución se guarda automáticamente en tu yoDEV Workplace.
Puedes formular la pregunta en inglés y en español para medir la diferencia. Jev se entrenó principalmente en inglés.
¿Qué pasa con los datos que subo?
Al Workplace solo se guardan las métricas y los números de fila, nunca el texto de tus filas. Las filas que subes se eliminan 30 días después de tu última ejecución con ese conjunto, y puedes eliminarlas antes en cualquier momento.
¿Qué hay de la Decisions API de OpenAI?
El 29 de septiembre de 2026, OpenAI anunció en su DevDay una Decisions API: un modelo que elige entre respuestas predefinidas por el desarrollador, en lugar de generar texto, la misma categoría que Jev. Al 30 de septiembre está en vista previa limitada, sin referencia pública de la API, precios ni límites. Resumen del DevDay 2026
Que dos proveedores apuesten por la misma idea confirma que las decisiones acotadas se están convirtiendo en una pieza propia de las aplicaciones con IA. También vuelve más importante la pregunta de siempre: ¿cuál funciona mejor en tu tarea? Cuando esa API tenga acceso público, tiene sentido medirla con el mismo método.
¿Qué límites tienen estas mediciones?
- Son 200 filas por conjunto y una sola ejecución por modelo, realizadas el 29 y 30 de septiembre de 2026 con Jev 1.13.
- La latencia depende de desde dónde se mide. Mide desde tu propia región antes de sacar conclusiones.
- La exactitud de Banking77 y SMS spam se mide con textos en inglés; la de moderación y sentimiento, con textos en español.
- El conjunto de moderación contiene lenguaje ofensivo.
Cada página de resultados enlaza a la fuente y a la licencia de su conjunto de datos.
yoDEV Decisions es una herramienta independiente de yoDEV, sin afiliación con TypeSafe AI ni con OpenAI. Jev es un producto de TypeSafe AI.

Top comments (0)