Benchmarks de IA
Un benchmark de IA mide el rendimiento de modelos de lenguaje en tareas reales: razonamiento, código, velocidad y coste. En Weben48 comparamos modelos con datos de Artificial Analysis y OpenRouter para que elijas con cifras, no con marketing.
El leaderboard Weben48
| Modelo | Creador | Inteligencia | Coding | Precio/1M | Contexto |
|---|---|---|---|---|---|
| Claude Opus 5 (max) | Anthropic | 60.7/100 | 78.0/100 | $10.00 | 1.0M |
| Claude Opus 5 (xhigh) | Anthropic | 60.1/100 | 77.0/100 | $10.00 | 1.0M |
| Claude Fable 5 (with fallback) | Anthropic | 59.9/100 | 76.5/100 | $20.00 | 1.0M |
| GPT-5.6 Sol (max) | OpenAI | 58.9/100 | 77.4/100 | $11.25 | 1.0M |
| Claude Opus 5 (high) | Anthropic | 58.9/100 | 76.5/100 | $10.00 | 1.0M |
| GPT-5.6 Sol (xhigh) | OpenAI | 57.7/100 | 78.3/100 | $11.25 | 1.0M |
| Kimi K3 (max) | Kimi | 57.1/100 | 76.2/100 | $6.00 | 1.0M |
| Claude Opus 5 (medium) | Anthropic | 56.3/100 | 74.3/100 | $10.00 | 1.0M |
| GPT-5.6 Sol (high) | OpenAI | 55.9/100 | 77.2/100 | $11.25 | 1.0M |
| GPT-5.6 Terra (max) | OpenAI | 55.0/100 | 76.7/100 | $4.50 | 1.0M |
| Muse Spark 1.2 (xhigh) | Meta | 54.1/100 | 72.2/100 | $2.00 | 1.0M |
| Grok 4.5 (high) | SpaceXAI | 53.8/100 | 72.4/100 | $3.00 | 500K |
| GPT-5.6 Sol (medium) | OpenAI | 53.6/100 | 76.3/100 | $11.25 | 1.0M |
| Claude Sonnet 5 (max) | Anthropic | 53.4/100 | 71.5/100 | $4.00 | 1.0M |
| GPT-5.6 Terra (xhigh) | OpenAI | 51.6/100 | 70.6/100 | $4.50 | 1.0M |
| GPT-5.6 Luna (max) | OpenAI | 51.2/100 | 71.4/100 | $0.45 | 1.0M |
| GLM-5.2 (max) | Z AI | 51.1/100 | 68.8/100 | $2.09 | 1.0M |
| Muse Spark 1.1 (xhigh) | Meta | 50.6/100 | 71.3/100 | $2.00 | 1.0M |
| Claude Opus 5 (low) | Anthropic | 50.6/100 | 66.9/100 | $10.00 | 1.0M |
| Gemini 3.5 Flash | 50.2/100 | 70.1/100 | $3.38 | 1.0M | |
| Gemini 3.6 Flash | 50.1/100 | 69.2/100 | $3.00 | 1.0M | |
| DeepSeek V4 Flash 0731 (max) | DeepSeek | 49.9/100 | 69.1/100 | $0.18 | 1.0M |
| GPT-5.6 Sol (low) | OpenAI | 49.4/100 | 69.7/100 | $11.25 | 1.0M |
| GPT-5.6 Luna (xhigh) | OpenAI | 49.1/100 | 68.6/100 | $0.45 | 1.0M |
| GPT-5.6 Terra (high) | OpenAI | 49.0/100 | 67.1/100 | $4.50 | 1.0M |
| Kimi K3 (low) | Kimi | 46.6/100 | 72.0/100 | $6.00 | 1.0M |
| Gemini 3.1 Pro Preview | 46.5/100 | 68.8/100 | $4.50 | 1.0M | |
| GPT-5.6 Luna (high) | OpenAI | 46.1/100 | 63.3/100 | $0.45 | 1.0M |
| Qwen3.7 Max | Alibaba | 46.0/100 | 66.0/100 | $3.75 | 1.0M |
| GPT-5.6 Terra (medium) | OpenAI | 45.6/100 | 64.7/100 | $4.50 | 1.0M |
* Índice estimado. Fuente: Artificial Analysis + OpenRouter.
Actualizado: 6 de agosto de 2026. Fuentes: Artificial Analysis y OpenRouter.
Preguntas frecuentes
¿Qué son los benchmarks de IA de Weben48?
Comparativas de modelos de lenguaje con datos de Artificial Analysis y OpenRouter: inteligencia, coding, precio, contexto y velocidad.
¿De dónde salen los datos?
Pruebas en entornos aislados de Artificial Analysis y precios públicos de OpenRouter. Enlazamos siempre a la fuente.
¿Cómo se lee el índice de inteligencia?
Agrega benchmarks de razonamiento y conocimiento. Lo mostramos en su escala original de 0 a 100.
Análisis y explicaciones
Benchmarks oficiales vs independientes: dos evidencias, no dos bandos
El laboratorio explica el producto y el independiente compara bajo un arnés común. Usar ambos reduce el riesgo de confundir marketing, configuración favorable y rendimiento general.
BenchmarkCoding por presupuesto: elegir modelo antes de abrir el editor
Un presupuesto de coding convierte una discusión abstracta en un límite operativo. Los modelos más capaces pueden ahorrar rondas; los baratos pueden ganar en tareas repetibles.
BenchmarkCómo leer el Intelligence Index sin convertirlo en dogma
El Intelligence Index es una síntesis útil porque agrupa tareas de agentes, código, ciencia y conocimiento. No es un sustituto de una evaluación en tu dominio ni de una prueba de coste.
BenchmarkContexto anunciado vs contexto útil: el límite que se descubre tarde
Una ventana grande solo ayuda si el modelo recupera lo relevante, mantiene instrucciones y no dispara el coste. El número anunciado es capacidad; la utilidad es una prueba.
BenchmarkGPT-5.6 vs Claude Opus 5 vs Gemini 3.6: una comparación que admite sus límites
Los tres modelos no compiten bajo el mismo esfuerzo, precio ni arnés. Un ranking puede orientar la primera prueba, pero debe conservar configuración, fecha y metodología.
BenchmarkModelos locales con 8, 16 y 24 GB: memoria no equivale a calidad
La VRAM define qué cabe y con qué cuantización; no garantiza que el modelo resuelva tu tarea. El contexto, la velocidad y el runtime alteran la experiencia final.
BenchmarkPrecio e inteligencia: el gráfico correcto es coste por tarea aceptada
El precio por millón de tokens es una entrada, no la factura final. La longitud de la respuesta, el caché y los reintentos cambian el coste que importa.