Saltar al contenido

Benchmarks de IA

Un benchmark de IA mide el rendimiento de modelos de lenguaje en tareas reales: razonamiento, código, velocidad y coste. En Weben48 comparamos modelos con datos de Artificial Analysis y OpenRouter para que elijas con cifras, no con marketing.

Top del momento

El leaderboard Weben48

Modelo Creador Inteligencia Coding Precio/1M Contexto
Claude Opus 5 (max) Anthropic 60.7/100 78.0/100 $10.00 1.0M
Claude Opus 5 (xhigh) Anthropic 60.1/100 77.0/100 $10.00 1.0M
Claude Fable 5 (with fallback) Anthropic 59.9/100 76.5/100 $20.00 1.0M
GPT-5.6 Sol (max) OpenAI 58.9/100 77.4/100 $11.25 1.0M
Claude Opus 5 (high) Anthropic 58.9/100 76.5/100 $10.00 1.0M
GPT-5.6 Sol (xhigh) OpenAI 57.7/100 78.3/100 $11.25 1.0M
Kimi K3 (max) Kimi 57.1/100 76.2/100 $6.00 1.0M
Claude Opus 5 (medium) Anthropic 56.3/100 74.3/100 $10.00 1.0M
GPT-5.6 Sol (high) OpenAI 55.9/100 77.2/100 $11.25 1.0M
GPT-5.6 Terra (max) OpenAI 55.0/100 76.7/100 $4.50 1.0M
Muse Spark 1.2 (xhigh) Meta 54.1/100 72.2/100 $2.00 1.0M
Grok 4.5 (high) SpaceXAI 53.8/100 72.4/100 $3.00 500K
GPT-5.6 Sol (medium) OpenAI 53.6/100 76.3/100 $11.25 1.0M
Claude Sonnet 5 (max) Anthropic 53.4/100 71.5/100 $4.00 1.0M
GPT-5.6 Terra (xhigh) OpenAI 51.6/100 70.6/100 $4.50 1.0M
GPT-5.6 Luna (max) OpenAI 51.2/100 71.4/100 $0.45 1.0M
GLM-5.2 (max) Z AI 51.1/100 68.8/100 $2.09 1.0M
Muse Spark 1.1 (xhigh) Meta 50.6/100 71.3/100 $2.00 1.0M
Claude Opus 5 (low) Anthropic 50.6/100 66.9/100 $10.00 1.0M
Gemini 3.5 Flash Google 50.2/100 70.1/100 $3.38 1.0M
Gemini 3.6 Flash Google 50.1/100 69.2/100 $3.00 1.0M
DeepSeek V4 Flash 0731 (max) DeepSeek 49.9/100 69.1/100 $0.18 1.0M
GPT-5.6 Sol (low) OpenAI 49.4/100 69.7/100 $11.25 1.0M
GPT-5.6 Luna (xhigh) OpenAI 49.1/100 68.6/100 $0.45 1.0M
GPT-5.6 Terra (high) OpenAI 49.0/100 67.1/100 $4.50 1.0M
Kimi K3 (low) Kimi 46.6/100 72.0/100 $6.00 1.0M
Gemini 3.1 Pro Preview Google 46.5/100 68.8/100 $4.50 1.0M
GPT-5.6 Luna (high) OpenAI 46.1/100 63.3/100 $0.45 1.0M
Qwen3.7 Max Alibaba 46.0/100 66.0/100 $3.75 1.0M
GPT-5.6 Terra (medium) OpenAI 45.6/100 64.7/100 $4.50 1.0M

* Índice estimado. Fuente: Artificial Analysis + OpenRouter.

Actualizado: 6 de agosto de 2026. Fuentes: Artificial Analysis y OpenRouter.

Preguntas frecuentes

¿Qué son los benchmarks de IA de Weben48?

Comparativas de modelos de lenguaje con datos de Artificial Analysis y OpenRouter: inteligencia, coding, precio, contexto y velocidad.

¿De dónde salen los datos?

Pruebas en entornos aislados de Artificial Analysis y precios públicos de OpenRouter. Enlazamos siempre a la fuente.

¿Cómo se lee el índice de inteligencia?

Agrega benchmarks de razonamiento y conocimiento. Lo mostramos en su escala original de 0 a 100.

Análisis y explicaciones

Benchmark

Benchmarks oficiales vs independientes: dos evidencias, no dos bandos

El laboratorio explica el producto y el independiente compara bajo un arnés común. Usar ambos reduce el riesgo de confundir marketing, configuración favorable y rendimiento general.

Benchmark

Coding por presupuesto: elegir modelo antes de abrir el editor

Un presupuesto de coding convierte una discusión abstracta en un límite operativo. Los modelos más capaces pueden ahorrar rondas; los baratos pueden ganar en tareas repetibles.

Benchmark

Cómo leer el Intelligence Index sin convertirlo en dogma

El Intelligence Index es una síntesis útil porque agrupa tareas de agentes, código, ciencia y conocimiento. No es un sustituto de una evaluación en tu dominio ni de una prueba de coste.

Benchmark

Contexto anunciado vs contexto útil: el límite que se descubre tarde

Una ventana grande solo ayuda si el modelo recupera lo relevante, mantiene instrucciones y no dispara el coste. El número anunciado es capacidad; la utilidad es una prueba.

Benchmark

GPT-5.6 vs Claude Opus 5 vs Gemini 3.6: una comparación que admite sus límites

Los tres modelos no compiten bajo el mismo esfuerzo, precio ni arnés. Un ranking puede orientar la primera prueba, pero debe conservar configuración, fecha y metodología.

Benchmark

Modelos locales con 8, 16 y 24 GB: memoria no equivale a calidad

La VRAM define qué cabe y con qué cuantización; no garantiza que el modelo resuelva tu tarea. El contexto, la velocidad y el runtime alteran la experiencia final.

Benchmark

Precio e inteligencia: el gráfico correcto es coste por tarea aceptada

El precio por millón de tokens es una entrada, no la factura final. La longitud de la respuesta, el caché y los reintentos cambian el coste que importa.