| Modelo | Rend.DI / MTEB ⇅ | Precio$/1M tok ⇅ | PesosPesos⇅ | MadurezMad.⇅ | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Perplexity Decider v1.1 27B Perplexity | 62,8 | self-host | AbiertoOpen | Poco probadoPoco prob. ⬇ 599/mes HF · 1 rankingPoco usadoPoco usado | |||||||
Tipo: Decisión tipada Destacado: ★ N.º 1 (open) Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: Poco probadoPoco prob. Muy poco uso · 599 descargas HF/mes · 1 leaderboard (Decision Index 0.3) · 4 días · Adopción: Poco usado (⬇ 599/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-10-05; datos del 2026-10-09) Nota: N.º 1 del Decision Index, por encima de Jev. Qué hace: Decisión tipada (choice/score/sí-no con probabilidades) sobre Qwen3.8-27B con máscara causal levantada y cabeza de decisión de 255 opciones. Memoria: disco 52,2 GB (BF16) · VRAM mín. 49,0 GB oficial (pesos) · cabe en: 1× 80 GB (BF16, oficial)
Requisito: Model card: «a CUDA GPU with room for roughly 49 GiB of weights plus working memory». fuente Calidad: Decision Index 0.3: 62,75 (Full score, n.º 1 de 115; Jev 60,11) · índice público 62,25 · la card declara 61,56 en 0.2.1 · Latencia: Mediana 104,1 ms (Decision Index 0.3, 1× RTX PRO 6000). · Precio: Self-host (GPU propia) v1 (= «AutoJev-27B», 56,4 en 0.2.1) → v1.1 (5 oct): más datos (tasksource) y sin máscara causal. Código propio (autojev); las cuantizaciones son de la comunidad. Licencia: Apache 2.0 Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Fastino GLiDE (28B, no-thinking) Fastino | 60,2 | n/d | CerradoCerr. | RecienteRecien. 1 ranking DI · pesos no públicosSin datos de usoSin datos | |||||||
Tipo: Decisión tipada Destacado: ★ N.º 2 DI Pesos: CerradoCerr. ↗ Web Madurez: RecienteRecien. Por defecto: en Decision Index 0.3.1 como n.º 2 · pesos aún no públicos · Adopción: Sin datos de uso (1 ranking DI · pesos no públicos) (leaderboards: Decision Index 0.3.1; lanzamiento: 2026-09-30; datos del 2026-10-10) Nota: N.º 2 del DI; pesos «coming soon». Qué hace: Modelo de decisión «thinking»/no-thinking: choice, sí/no y score con probabilidades; no genera texto libre. Pesos «coming soon» según DI. Memoria: Pesos aún no públicos Calidad: Decision Index 0.3.1: Full 60,21 (n.º 2 de 116) · público 59,06. Solo por detrás de Perplexity Decider v1.1 (62,75). · Latencia: Mediana 98,4 ms (Decision Index 0.3.1). · Precio: n/d (API; precio público no listado en DI) Entrada del leaderboard oficial 0.3.1 (generado 2026-10-10). Meta DI: «Open weights coming soon». No confundir con GLiNER. Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-10 | |||||||||||
| Jev 1.13 (System One) TypeSafe AI | 60,1 | $0,042/1M | CerradoCerr. | RecienteRecien. OpenRouter top 20 · #9 · 1 rankingMuy usadoMuy usado | |||||||
Tipo: Decisión tipada Destacado: ★ Mejor API Pesos: CerradoCerr. ↗ Web Madurez: RecienteRecien. Salió hace 22 días · top 20 OpenRouter · 1 leaderboard (Decision Index 0.3) · Adopción: Muy usado (OpenRouter top 20 · #9 · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-09-17; datos del 2026-10-09) Nota: Única API del top; 64k de contexto; no afinable. Qué hace: Lee un estado (texto/JSON) y responde preguntas tipadas: choice (hasta 255 opciones), score (2–10 niveles) o sí/no, con probabilidades y confianza. Sin generar texto. Memoria: Hospedado (no se descarga) Calidad: Decision Index 0.3: 60,11 (Full score, n.º 3 de 115) · índice público 57,96 · Latencia: Mediana 524 ms por petición medida por el Decision Index (API alojada, ida y vuelta de red); TypeSafe anuncia 70–500 ms. · Precio: 0,042 $/1M tokens de entrada; salida gratis En el Decision Index 0.3 (7 oct) queda 3.º, empatado con Fastino GLiDE (pesos «próximamente») y por detrás de Perplexity Decider v1.1 (open). Contexto 64k; mejor en inglés; no se puede afinar. También en Vercel AI Gateway (typesafe-ai/jev). Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Torchcast Decision 27B Torchcast AI | 59,9 | self-host | AbiertoOpen | Poco probadoPoco prob. ⬇ 602/mes HF · 1 rankingPoco usadoPoco usado | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: Poco probadoPoco prob. Muy poco uso · 602 descargas HF/mes · 1 leaderboard (Decision Index 0.3) · 6 días · Adopción: Poco usado (⬇ 602/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-10-03; datos del 2026-10-09) Nota: Mejor índice público, pero licencia no comercial. Qué hace: Decisión tipada sobre Qwen3.8-27B (LoRA fusionado); contexto 256k. Memoria: disco 54,7 GB (BF16) · VRAM mín. 20,0 GB aprox. · cabe en: 1× 24 GB (aprox.)
Calidad: Decision Index 0.3: 59,91 (Full, n.º 4) · índice público 65,10 (n.º 1) · el índice guió la elección del checkpoint (declarado) · Latencia: Mediana 99,9 ms (Decision Index 0.3) · card: 33 ms por pregunta sí/no en 1× H100. · Precio: Self-host (GPU propia) Gran salto público (65,1) que se reduce en los tests privados (Full 59,9). También hay versión 12B. Licencia: CC BY-NC 4.0 (no comercial) Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Kev 27B Jared Palmer | 58,8 | self-host | AbiertoOpen | RecienteRecien. ⬇ 1,5k/mes HF · 1 rankingPoco usadoPoco usado | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: RecienteRecien. Salió hace 15 días · 2k descargas HF/mes · 1 leaderboard (Decision Index 0.3) · Adopción: Poco usado (⬇ 1,5k/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-09-24; datos del 2026-10-09) Nota: El más calibrado del top; datos con licencia comercial. Qué hace: Decisión tipada (fine-tune completo de Qwen3.8-27B + cabeza); estados de hasta 64k tokens. Memoria: disco 51,2 GB (BF16) · VRAM mín. 65,5 GB oficial · cabe en: 1× 80 GB (H100/H200/B200, oficial)
Requisito: Model card: pesos 51 GB, servidor ~65,5 GB residente; estados de 64k llegan a 87,1 GB (H200). fuente Calidad: Decision Index 0.3: 58,78 (Full, n.º 6) · público 56,69 · mejor nota en dominios nuevos privados entre los open (55,5) · ECE 0,022 · Latencia: Mediana 135 ms (Decision Index 0.3). · Precio: Self-host (GPU propia) Card: datos de fuentes con licencias que permiten uso comercial y cribado de contaminación. Solo inglés. Licencia: Apache 2.0 Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Blink v0.3 26B-A4B Pixilab.ai | 57,8 | self-host | AbiertoOpen | Poco probadoPoco prob. ⬇ 765/mes HF · 1 rankingPoco usadoPoco usado | |||||||
Tipo: Decisión tipada Destacado: ★ Nivel Jev a 25 ms Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: Poco probadoPoco prob. Muy poco uso · 765 descargas HF/mes · 1 leaderboard (Decision Index 0.3) · 7 días · Adopción: Poco usado (⬇ 765/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-10-02; datos del 2026-10-09) Nota: Nivel Jev a 25 ms en 1 GPU. Qué hace: Decisión tipada sobre Gemma 4 26B-A4B (MoE, 4B activos), publicado ya cuantizado (NVFP4 / FP8). Memoria: disco 18,8 GB (NVFP4) · VRAM mín. 23,0 GB aprox. · cabe en: 1× 32 GB (aprox.)
Requisito: Model card: «17.5 GB on disk, served on a single RTX PRO 5000 with 32k context». fuente Calidad: Decision Index 0.3: 57,76 (Full, n.º 8) · público 58,21 · ECE 0,040 · Latencia: Mediana 25,1 ms (Decision Index 0.3): el más rápido del top 10. · Precio: Self-host (GPU propia) NVFP4 para GPU Blackwell; build FP8 para Hopper/Ada. Card: 32k de contexto en una RTX PRO 5000. Licencia: Apache 2.0 Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Rune 26B-A4B v3 Surogate | 57,4 | self-host | AbiertoOpen | RecienteRecien. ⬇ 5,2k/mes HF · 1 rankingUso medioUso medio | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen ↗ Web Madurez: RecienteRecien. Salió hace 18 días · 5k descargas HF/mes · 1 leaderboard (Decision Index 0.3) · Adopción: Uso medio (⬇ 5,2k/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-09-21; datos del 2026-10-09) Nota: MoE 4B activos; GGUF de la comunidad. Qué hace: Modelo de decisión tipada abierto (fine-tune completo de Gemma 4 26B-A4B). Memoria: disco 51,6 GB (n/d) · VRAM mín. 20,0 GB aprox. · cabe en: 1× 24 GB (aprox.)
Calidad: Decision Index 0.3: 57,43 (Full score, n.º 10 de 115) · índice público 58,28 · Latencia: Mediana 120,5 ms (Decision Index 0.3, 1× RTX PRO 6000, BF16, cliente secuencial). · Precio: Self-host (GPU propia) Casi el nivel de Jev en abierto; en BF16 pide 1× 80 GB, cuantizado 1× 24–32 GB (aprox.). Licencia: Apache 2.0 (repo gated) Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Bespoke Nimble 9B v3 Bespoke Labs | 54,7 | self-host | AbiertoOpen | Poco probadoPoco prob. ⬇ 189/mes HF · 1 rankingPoco usadoPoco usado | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: Poco probadoPoco prob. Muy poco uso · 189 descargas HF/mes · 1 leaderboard (Decision Index 0.3) · 9 días · Adopción: Poco usado (⬇ 189/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-09-30; datos del 2026-10-09) Nota: Mejor ≤10B; licencia no comercial. Qué hace: Adaptador LoRA de decisión tipada para Qwen3.5-9B (choice o sí/no con probabilidad por opción). Memoria: disco 17,9 GB (LoRA 0,69 GB + base) · VRAM mín. 9,0 GB aprox. · cabe en: 1× 8–12 GB (aprox.)
Disco = GGUF BF16 fusionado; el adaptador oficial pesa 0,69 GB y necesita la base Qwen3.5-9B. Calidad: Decision Index 0.3: 54,67 (Full, n.º 18; mejor ≤10B) · público 57,19 · Latencia: Mediana 73,9 ms (Decision Index 0.3). · Precio: Self-host (GPU propia) El repo oficial es solo el LoRA (0,69 GB) sobre Qwen3.5-9B (Apache 2.0); ggml-org publica GGUF fusionados. Licencia: CC BY-NC 4.0 (no comercial) Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Drex v1.5 Nace.AI | 50,8 | $0,040/1M | AbiertoOpen | RecienteRecien. HF ~98 descargas/mes · OpenRouter · 1 rankingPoco usadoPoco usado | |||||||
Tipo: Decisión tipada Destacado: ★ Open ≤10B (público) Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: RecienteRecien. Por defecto: salió hace ~1 día · en Decision Index 0.3.1 · pesos open + API · Adopción: Poco usado (HF ~98 descargas/mes · OpenRouter · 1 ranking) (leaderboards: Decision Index 0.3.1; lanzamiento: 2026-10-09; datos del 2026-10-10) Nota: Open ≤10B con mejor índice público; Full baja a 50,8. Licencia RAIL-M. Qué hace: Decisiones tipadas (choice / noul sí-no / score) sobre un estado texto/JSON; una pasada por pregunta, sin generar texto. Compatible con System One (/v1/systemone) de Jev. Memoria: disco 17,9 GB (BF16) · VRAM mín. 24,0 GB oficial · cabe en: 1× GPU 24 GB (A10G bf16, test Nace) · Q8_0 ~9,5 GB en Metal/CPU
Requisito: Model card: bf16 ~18 GB en una GPU CUDA (probado en A10G 24 GB); Q8_0 GGUF ~9,5 GB en Apple silicon o CPU. fuente Q8_0 no está como repo GGUF listo: se convierte con el fork llama.cpp de Nace (rama drex-v1.5). GB Q8 según model card. Calidad: Decision Index 0.3.1: Full 50,84 (n.º 24 de 116) · índice público 58,08 (mejor open ≤10B en público; empate 0,9 pts con Jev/Nimble en público). JevBench 86,2 % (Jev 87,0 %). · Latencia: Mediana 53,5 ms (Decision Index 0.3.1, panel oficial). OpenRouter P50 ~0,18 s (DeepInfra). Model card: ~0,65 s (8k–32k) · ~2,0 s (32k–128k) en docs largos. · Precio: Self-host · API OpenRouter 0,04 $/1M entrada (salida gratis) Pesos en HF (2026-10-09 en OpenRouter). Base XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B. Contexto 16k por defecto, hasta 131k. API propia drex.nace.ai y OpenRouter nace-ai/drex-v1.5 a 0,04 $/1M in. En DI Full queda lejos de Decider/GLiDE/Jev por tests privados (debilidad en knowledge: p. ej. GPQA). Forks propios de llama.cpp/Ollama. Licencia: Nace.AI Open RAIL-M (uso restringido; no es Apache) Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-10 | |||||||||||
| ezjev 4B s2 everettjf | 47,0 | self-host | AbiertoOpen | Poco probadoPoco prob. ⬇ 83/mes HF · 1 rankingPoco usadoPoco usado | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: Poco probadoPoco prob. Muy poco uso · 83 descargas HF/mes · 1 leaderboard (Decision Index 0.3) · 6 días · Adopción: Poco usado (⬇ 83/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-10-03; datos del 2026-10-09) Nota: Mejor ~4B; revisa licencias antes de uso comercial. Qué hace: Decisión tipada sobre Qwen3.5-4B (LoRA fusionado), servido con vLLM. Memoria: disco 9,1 GB (BF16) · VRAM mín. 5,0 GB aprox. · cabe en: 1× 8–12 GB (aprox.)
Calidad: Decision Index 0.3: 46,95 (Full, n.º 35; mejor ~4B) · público 50,82 · entrenado con splits train/dev de ~17 benchmarks del índice (declarado) · Latencia: Mediana 35,5 ms (Decision Index 0.3, 1× RTX PRO 6000). · Precio: Self-host (GPU propia) El autor recomienda ya ezjev-4b-s3 (sin nota en el board). Algunas fuentes de entrenamiento son no comerciales (p. ej. ANLI). Licencia: Otra (código MIT; datos con fuentes NC) Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Decider 4B Mapika | 40,3 | self-host | AbiertoOpen | RecienteRecien. ⬇ 25k/mes HF · 1 rankingUso medioUso medio | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen ↗ Web Madurez: RecienteRecien. Salió hace 17 días · 25k descargas HF/mes · 1 leaderboard (Decision Index 0.3) · Adopción: Uso medio (⬇ 25k/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-09-22; datos del 2026-10-09) Nota: 13 ms; receta abierta (Mapika). Qué hace: Decisiones tipadas con probabilidades calibradas en una pasada (familia decider 2B/4B/35B-A3B). Memoria: disco 8,4 GB (n/d) · VRAM mín. 11,0 GB aprox. · cabe en: 1× 16 GB (aprox.)
Calidad: Decision Index 0.3: 40,33 (Full score, n.º 50 de 115) · índice público 41,19 · Latencia: Mediana 12,6 ms (Decision Index 0.3, FP8 + CUDA graphs, 1× RTX PRO 6000). · Precio: Self-host (GPU propia) Familia Decider 2B / 4B / 35B-A3B (35B-A3B: Full 48,5). Licencia permisiva; receta en github.com/Mapika/decider. Licencia: Apache 2.0 Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Liquid AI d1-3B Liquid AI | 40,1 | self-host | AbiertoOpen | RecienteRecien. ⬇ 5,4k/mes HF · 1 rankingUso medioUso medio | |||||||
Tipo: Decisión tipada Destacado: ★ Mejor edge Pesos: AbiertoOpen ↗ Web Madurez: RecienteRecien. Salió hace 4 días · 5k descargas HF/mes · 1 leaderboard (Decision Index 0.3) · Adopción: Uso medio (⬇ 5,4k/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-10-05; datos del 2026-10-09) Nota: Edge: 6 GB, 16 ms; texto + imagen. Qué hace: Modelo de decisión: una sola pasada, cero tokens de salida; choice/score/sí-no con confianza y probabilidades. Texto + imagen. Memoria: disco 6,2 GB (BF16) · VRAM mín. 4,0 GB aprox. · cabe en: Cualquier GPU de 8 GB, Jetson o Mac
Requisito: Model card: 8 ms por decisión en RTX 4090 (bf16); también Jetson Orin Nano (50 ms) y Apple M5 Pro (30 ms). fuente Calidad: Decision Index 0.3: 40,08 (Full score, n.º 51 de 115) · índice público 48,99 · Latencia: Mediana 16,1 ms (Decision Index 0.3; envío de Liquid AI en AMD MI325X) · model card: 8 ms en RTX 4090, 30 ms Apple M5 Pro, 50 ms Jetson Orin Nano. · Precio: Self-host (GPU propia) En el índice público saca 49,0, pero en los tests privados baja (Full 40,1). Contexto 32k. Licencia: LFM Open License 1.0 Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Liquid AI d1-omni-600M Liquid AI | 9,4 | self-host | AbiertoOpen | RecienteRecien. ⬇ 8,5k/mes HF · 1 rankingUso medioUso medio | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen ↗ Web Madurez: RecienteRecien. Salió hace 4 días · 8k descargas HF/mes · 1 leaderboard (Decision Index 0.3) · Adopción: Uso medio (⬇ 8,5k/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-10-05; datos del 2026-10-09) Nota: Texto, imagen y audio; para edge. Qué hace: Versión mini de d1: decisiones sobre texto, imagen y audio con cero tokens de salida. Memoria: disco 2,4 GB (n/d) · VRAM mín. 2,0 GB aprox. · cabe en: 1× 8–12 GB (aprox.) Calidad: Decision Index 0.3: 9,45 (Full score, n.º 97 de 115) · índice público 17,90 · Latencia: Mediana 10,9 ms (Decision Index 0.3, envío de Liquid AI). · Precio: Self-host (CPU/edge) Para filtros masivos baratos o en dispositivo; contexto 16k. Licencia: LFM Open License 1.0 Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Laya Convai Innovations | 4,4 | self-host | AbiertoOpen | RecienteRecien. ⬇ 36k/mes HF · 1 rankingMuy usadoMuy usado | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: RecienteRecien. Salió hace 21 días · 36k descargas HF/mes · 1 leaderboard (Decision Index 0.3) · Adopción: Muy usado (⬇ 36k/mes HF · 1 ranking) (leaderboards: Decision Index 0.3; lanzamiento: 2026-09-18; datos del 2026-10-09) Nota: Rapidísimo, pero ~azar sin afinar: solo útil afinado con tus etiquetas. Qué hace: Codificador no autorregresivo (ModernBERT-large + cabeza de decisión, entrenado con RLCD): choice/score/sí-no en una pasada. Familia: laya (inglés, 421M), laya-multilingual (mmBERT-base, 322M) y laya-typed-decisions (afinado). Memoria: disco 0,8 GB (F16) · VRAM mín. 2,0 GB aprox. · cabe en: Cualquier GPU (CPU posible, más lento)
Calidad: Decision Index 0.3: 4,43 (Full, n.º 106 de 115) · público 6,19 · 0.2.1: 6,04 · card: 0,36 de acierto zero-shot (azar 0,32); 0,766 solo el checkpoint afinado en esa misma tarea · Latencia: Mediana 5,8 ms (Decision Index 0.3, CUDA graphs, 1× RTX PRO 6000) · autor: 33 ms por pregunta en T4. · Precio: Self-host · gratis en Vercel AI Gateway hasta el 31 oct (promo, @vercel_dev 1 oct) Las comparativas «mejor que Jev» de la card usan otras muestras y un checkpoint afinado en esa tarea; Jev no se midió en la misma suite. Opciones limitadas (≲20). Servible con llama.cpp (/v1/systemone, ggml-org/Laya-GGUF). Hospedado: gratis en Vercel AI Gateway hasta el 31 oct (https://x.com/vercel_dev/status/2105758650052849859); también en Dell Enterprise Hub. Licencia: Apache 2.0 Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-08 | |||||||||||
| Qwen3-Embedding-8B / 0.6B Alibaba | MTEB-M 70,6 / 64,3 | self-host | AbiertoOpen | ConsolidadoConsol. ⬇ 11,2M/mes HF · 1 rankingMuy usadoMuy usado | |||||||
Tipo: Embeddings · recuperar Destacado: ★ Recuperar Pesos: AbiertoOpen ↗ Web Madurez: ConsolidadoConsol. Uso masivo · 11,2 M descargas HF/mes · 1 leaderboard (MTEB) · desde 2025-06 · Adopción: Muy usado (⬇ 11,2M/mes HF · 1 ranking) (leaderboards: MTEB; lanzamiento: 2025-06-03; datos del 2026-10-09) Nota: Multilingüe, 32k, dimensión configurable. Qué hace: Embeddings multilingües (100+ idiomas) para recuperar candidatos ↔ ofertas por similitud; dimensión configurable (MRL) e instrucciones por tarea. Memoria: disco 15,1 GB (n/d) · VRAM mín. 3,0 GB aprox. · cabe en: 0.6B: CPU o cualquier GPU · 8B: 1× 24 GB (aprox.) Calidad: MTEB multilingüe: 70,58 (8B) / 64,33 (0.6B) · Latencia: n/d · Precio: Self-host (GPU propia) Contexto 32k (CVs largos). El 0.6B es el punto dulce para indexar millones de perfiles. Licencia: Apache 2.0 Fuente: huggingface.co/Qwen/Qwen3-Embedding-8B · 2026-10-08 | |||||||||||
| EmbeddingGemma-300m Google | Mejor <500M en MTEB (Google) | self-host | AbiertoOpen | ConsolidadoConsol. ⬇ 3,6M/mes HF · 1 rankingMuy usadoMuy usado | |||||||
Tipo: Embeddings · recuperar Pesos: AbiertoOpen ↗ Web Madurez: ConsolidadoConsol. Uso masivo · 3,6 M descargas HF/mes · 1 leaderboard (MTEB) · desde 2025-07 · Adopción: Muy usado (⬇ 3,6M/mes HF · 1 ranking) (leaderboards: MTEB; lanzamiento: 2025-07-17; datos del 2026-10-09) Nota: On-device; contexto 2k (trocear CVs). Qué hace: Embeddings multilingües muy ligeros (308M) para dispositivo o CPU; 768→128 dimensiones (MRL). Memoria: disco 1,2 GB (n/d) · VRAM mín. 0,2 GB oficial (RAM, QAT) · cabe en: CPU / móvil (<200 MB de RAM cuantizado, QAT)
Requisito: Google: corre en menos de 200 MB de RAM con cuantización (QAT). fuente Calidad: Mejor embedding multilingüe abierto <500M en MTEB (según Google) · Latencia: <15 ms con 256 tokens (EdgeTPU) · Precio: Self-host (CPU) Contexto 2k: corto para CVs completos (trocear). Licencia: Gemma Fuente: developers.googleblog.com/en/introducing-embeddinggemma/ · 2026-10-08 | |||||||||||
| BGE-M3 BAAI | MTEB-M 59,6 | self-host | AbiertoOpen | ConsolidadoConsol. ⬇ 33,2M/mes HF · 1 rankingMuy usadoMuy usado | |||||||
Tipo: Embeddings · recuperar Pesos: AbiertoOpen ↗ Web Madurez: ConsolidadoConsol. Uso masivo · 33,2 M descargas HF/mes · 1 leaderboard (MTEB) · desde 2024-01 · Adopción: Muy usado (⬇ 33,2M/mes HF · 1 ranking) (leaderboards: MTEB; lanzamiento: 2024-01-27; datos del 2026-10-09) Nota: Denso + léxico + ColBERT; 8k. Qué hace: Embedding híbrido: denso + léxico (sparse) + multivector (ColBERT) en un modelo; útil cuando importan términos exactos (skills, títulos). Memoria: disco 2,3 GB (n/d) · VRAM mín. 4,0 GB aprox. · cabe en: 1× 8–12 GB (aprox.)
Calidad: MTEB multilingüe: 59,56 (tabla de Qwen, may 2025) · Latencia: n/d · Precio: Self-host (GPU o CPU propia) Contexto 8192. Veterano y muy probado; menor nota que Qwen3 pero búsqueda híbrida nativa. Licencia: MIT Fuente: huggingface.co/BAAI/bge-m3 · 2026-10-08 | |||||||||||
| Voyage voyage-4 / 4-large Voyage AI | n/d | $0,060/1M | CerradoCerr. | ConsolidadoConsol. 1 rankingSin datos de usoSin datos | |||||||
Tipo: Embeddings · recuperar Pesos: CerradoCerr. ↗ Web Madurez: ConsolidadoConsol. Veterano · 1 leaderboard (MTEB) · desde 2026-01 · Adopción: Sin datos de uso (1 ranking) (leaderboards: MTEB; lanzamiento: 2026-01-15; datos del 2026-10-09) Nota: 200M tokens gratis; lite 0,02 $/1M. Qué hace: Embeddings por API sin infraestructura. Memoria: Hospedado Calidad: n/d · Latencia: n/d · Precio: 0,06 $/1M (voyage-4) · 0,12 $/1M (4-large); 200M tokens gratis voyage-4-lite 0,02 $/1M. Batch API −33 %. Fuente: docs.voyageai.com/docs/pricing · 2026-10-08 | |||||||||||
| Qwen3-Reranker-4B / 0.6B Alibaba | MMTEB-R 72,7 / 66,4 | self-host | AbiertoOpen | ConsolidadoConsol. ⬇ 3,9M/mes HF · 0 rankingsMuy usadoMuy usado | |||||||
Tipo: Rerankers · reordenar Destacado: ★ Reordenar Pesos: AbiertoOpen ↗ Web Madurez: ConsolidadoConsol. Uso masivo · 3,9 M descargas HF/mes · desde 2025-05 · sin leaderboard independiente en las fuentes consultadas · Adopción: Muy usado (⬇ 3,9M/mes HF · 0 rankings) (lanzamiento: 2025-05-29; datos del 2026-10-09) Nota: Cross-encoder con instrucción; 32k. Qué hace: Cross-encoder: puntúa cada par (oferta, candidato) leyendo ambos a la vez; reordena el top-k que trae el embedding. Memoria: disco 8,0 GB (n/d) · VRAM mín. 3,0 GB aprox. · cabe en: 0.6B: cualquier GPU · 4B: 1× 12–16 GB (aprox.) Calidad: MMTEB-R: 72,74 (4B) / 66,36 (0.6B); BGE-reranker-v2-m3: 58,36 · Latencia: n/d · Precio: Self-host (GPU propia) Contexto 32k; acepta instrucción («¿encaja este perfil con la oferta?»). Licencia: Apache 2.0 Fuente: huggingface.co/Qwen/Qwen3-Reranker-0.6B · 2026-10-08 | |||||||||||
| bge-reranker-v2-m3 BAAI | MMTEB-R 58,4 | self-host | AbiertoOpen | ConsolidadoConsol. ⬇ 16,6M/mes HF · 0 rankingsMuy usadoMuy usado | |||||||
Tipo: Rerankers · reordenar Pesos: AbiertoOpen ↗ Web Madurez: ConsolidadoConsol. Uso masivo · 16,6 M descargas HF/mes · desde 2024-03 · sin leaderboard independiente en las fuentes consultadas · Adopción: Muy usado (⬇ 16,6M/mes HF · 0 rankings) (lanzamiento: 2024-03-15; datos del 2026-10-09) Nota: Pareja de BGE-M3. jina-reranker-v3 es no comercial. Qué hace: Cross-encoder multilingüe ligero; pareja natural de BGE-M3. Memoria: disco 2,3 GB (n/d) · VRAM mín. 4,0 GB aprox. · cabe en: 1× 8–12 GB (aprox.)
Calidad: MMTEB-R: 58,36 (tabla de Qwen) · Latencia: n/d · Precio: Self-host (GPU o CPU propia) Alternativa: jina-reranker-v3 (0,6B) es CC-BY-NC, no apta para uso comercial. Licencia: Apache 2.0 Fuente: huggingface.co/BAAI/bge-reranker-v2-m3 · 2026-10-08 | |||||||||||
| Voyage rerank-3 / rerank-3-lite Voyage AI | n/d | $0,050/1M | CerradoCerr. | Poco probadoPoco prob. 0 rankingsSin datos de usoSin datos | |||||||
Tipo: Rerankers · reordenar Pesos: CerradoCerr. ↗ Web Madurez: Poco probadoPoco prob. Sin benchmark independiente · 38 días · Adopción: Sin datos de uso (0 rankings) (lanzamiento: 2026-09-01; datos del 2026-10-09) Nota: ~0,0025 $ por consulta de 100 docs. Qué hace: Reranker por API. Memoria: Hospedado Calidad: n/d · Latencia: n/d · Precio: 0,05 $/1M tokens (rerank-3) · 0,02 $/1M (lite); ~0,0025 $ por petición de 100 docs Tokens facturados = tokens de la consulta × n.º de docs + tokens de los docs. 200M gratis. Fuente: docs.voyageai.com/docs/pricing · 2026-10-08 | |||||||||||
| OpenAI Decisions API (GPT-6 Luna) OpenAI | n/d (no está en el DI) | $0,10/1M | CerradoCerr. | Poco probadoPoco prob. 0 rankingsSin datos de usoSin datos | |||||||
Tipo: Decisión tipada Pesos: CerradoCerr. ↗ Web Madurez: Poco probadoPoco prob. Sin benchmark independiente · 3 días · Adopción: Sin datos de uso (0 rankings) (lanzamiento: 2026-10-06; datos del 2026-10-09) Nota: Rival directo de Jev (beta pública 6 oct); acepta imágenes. Qué hace: Endpoint /v1/decisions: preguntas predicate (sí/no), choice o score sobre texto o imágenes, con respuesta estructurada; usa GPT-6 Luna. Memoria: Hospedado Calidad: No está en el Decision Index 0.3. · Latencia: OpenAI: hasta 10× más rápido que GPT-6 Luna por la Responses API. Sin medición independiente. · Precio: 0,10 $/1M tokens de entrada; salida y caché gratis Jev cuesta 0,042 $/1M de entrada y solo acepta texto. OpenAI reconoce que Jev «inspiró» el producto. Fuente: fortune.com/2026/10/08/jev-an-ai-for-making-quick-decisions-has-been-a · 2026-10-09 | |||||||||||
| Microsoft-Decision-1 Microsoft | n/d (aún no en DI) | $0,042/1M | CerradoCerr. | RecienteRecien. OpenRouter (nuevo) · 0 rankings DISin datos de usoSin datos | |||||||
Tipo: Decisión tipada Destacado: ★ Nuevo API MS Pesos: CerradoCerr. ↗ Web Madurez: RecienteRecien. Por defecto: salió hace 1 día · sin Decision Index aún · API en OpenRouter · Adopción: Sin datos de uso (OpenRouter (nuevo) · 0 rankings DI) Nota: Mismo precio que Jev (0,042 $/1M in); pesos no públicos. Qué hace: Decisiones tipadas (sí/no, choice, score/rúbrica) con probabilidades calibradas; post-entrenado sobre Qwen3.5-9B. API Decisions (Foundry + OpenRouter), no genera texto. Memoria: Hospedado Calidad: No está en Decision Index 0.3.1 (snapshot 2026-10-09). Microsoft: mejor accuracy en su pack de 36 benches ciegos (~150k preguntas) frente a H2O-Lightning-4B, Rune, Quyet, GPT-6 Luna Decisions, etc. · Latencia: OpenRouter P50 ~0,30 s (Azure). Microsoft: P50 ~35× más rápido que GPT-6 Sol en su bench interno. · Precio: 0,042 $/1M entrada; salida gratis (igual que Jev) Lanzado 2026-10-09 en Foundry y OpenRouter. Pesos cerrados (base open Qwen3.5-9B). Xbox Research: competitivo con GPT-6 Sol a >14× velocidad y ~200× menos coste en etiquetado. Ideal matching/routing/clasificación. Fuente: commandline.microsoft.com/microsoft-decision-1-model-foundry/ · 2026-10-10 | |||||||||||
| JEV-27B-VL (AutoTrust) AutoTrust AI | DI visión 69,8 (n.º 1) | self-host | AbiertoOpen | RecienteRecien. ⬇ 1,5M/mes HF · 1 rankingMuy usadoMuy usado | |||||||
Tipo: Decisión tipada Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: RecienteRecien. Salió hace 9 días · 1,5 M descargas HF/mes · 1 leaderboard (Decision Index (visión)) · Adopción: Muy usado (⬇ 1,5M/mes HF · 1 ranking) (leaderboards: Decision Index (visión); lanzamiento: 2026-09-30; datos del 2026-10-09) Nota: El mejor del Decision Index con imágenes. Qué hace: Decisión tipada sobre imágenes + texto (adaptador LoRA sobre base 27B); endpoint /v1/decide en vLLM. Memoria: disco 55,6 GB (BF16) · VRAM mín. 2,0 GB aprox. · cabe en: 1× 8–12 GB (aprox.)
AutoTrust dice que hay variantes cuantizadas; no verificadas aquí. Calidad: Tablero de visión del Decision Index: 69,82 Full (n.º 1), 72,78 público; 2.º Solomon v1.1 con 67,66. Su hermano GEV-26B-Decide hace 56,17 en el índice general 0.3. · Latencia: Mediana 263,9 ms por fila en el tablero de visión del Decision Index. · Precio: Self-host (GPU propia) Licencia: Apache 2.0 (adaptadores); base con su licencia Fuente: huggingface.co/spaces/multimodalart/jev-decision-index · 2026-10-09 | |||||||||||
| EmbeddingGemma 2 Google | MTEB Code 78,7 | self-host | AbiertoOpen | Poco probadoPoco prob. ⬇ 21k/mes HF · 0 rankingsMuy usadoMuy usado | |||||||
Tipo: Embeddings · recuperar Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: Poco probadoPoco prob. Sin benchmark independiente · 21k descargas HF/mes · 25 días · Adopción: Muy usado (⬇ 21k/mes HF · 0 rankings) (lanzamiento: 2026-09-14; datos del 2026-10-09) Nota: Sucesor del 300m: Apache 2.0, contexto 8k (4×). Qué hace: Embeddings multimodales (texto, código, imagen, vídeo y audio) en un mismo espacio; 768→128 dimensiones (MRL); contexto 8k. Memoria: disco 1,5 GB (BF16) · VRAM mín. 0,6 GB oficial (RAM, cuantizado) · cabe en: CPU / móvil (~191 MB de RAM solo texto, ~567 MB multimodal, cuantizado)
Requisito: Google: ~191 MB de RAM activa solo texto y ~567 MB multimodal, cuantizado, en un Pixel 11 Pro. fuente Calidad: Google: líder <1B multimodal en MTEB Code y MAEB; MTEB Code 68,76 → 78,68 frente a EmbeddingGemma 1. · Latencia: On-device; Google no da latencia. · Precio: Self-host (CPU/móvil) Licencia: Apache 2.0 Fuente: blog.google/innovation-and-ai/technology/developers-tools/embeddinggem · 2026-10-09 | |||||||||||
| pplx-embed-v2-late 0.6B / 9B Perplexity | ViDoRe v3 62,3 / 65,2 | self-host | AbiertoOpen | RecienteRecien. ⬇ 1k/mes HF · 1 rankingPoco usadoPoco usado | |||||||
Tipo: Embeddings · recuperar Pesos: AbiertoOpen 🤗 Hugging Face · ↗ Web Madurez: RecienteRecien. Solo 1 leaderboard (MTEB) · 1k descargas HF/mes · 81 días · Adopción: Poco usado (⬇ 1k/mes HF · 1 ranking) (leaderboards: MTEB; lanzamiento: 2026-07-20; datos del 2026-10-09) Nota: Multivector: más preciso, pero el índice ocupa más. Qué hace: Recuperación multivector (ColBERT, MaxSim) de texto, imágenes y PDFs sin OCR; los dos tamaños comparten espacio (indexa con 9B, consulta con 0.6B). Memoria: disco 2,4 GB (F32) · VRAM mín. 5,0 GB aprox. · cabe en: 1× 8–12 GB (aprox.) Pesos publicados en F32; en BF16 serían la mitad. Calidad: ViDoRe v3 nDCG@10 (imagen): 62,3 (0.6B) y 65,2 (9B), según las model cards. · Latencia: n/d · Precio: Self-host (GPU propia) Licencia: MIT Fuente: aicoder.com/news/news-20261008-perplexity-pplx-embed-v2-late-multimoda · 2026-10-09 | |||||||||||
Matching típico: embedding (recuperar top-200) → reranker (top-20) → modelo de decisión (sí/no con confianza). Decision Index 0.3 (board oficial multimodalart/jev-decision-index, datos del 7 oct): «Full score» = 20 % benchmarks públicos + 50 % tests privados de las mismas habilidades + 30 % tareas privadas de dominios nuevos, corregido por azar (0 = azar, 100 = perfecto). Latencia = mediana por petición medida por el board (1× RTX PRO 6000, cliente secuencial; Jev = API con red). MTEB/MMTEB-R: tablas de las model cards de Qwen.