Los modelos de IA más poderosos.
Y cuánto valen de verdad.
Ocho categorías —texto, código, agentes, velocidad, imagen, voz, música y video—, quién manda en cada una, qué cuesta, dónde está el sweet spot y cómo se ha movido la carrera día a día. En tabla, en barras, en mapa o en el tiempo: tú eliges cómo leerlo. Benchmarks independientes, actualizados cada día a las 6:00 am.
//Hoy en el ranking
El top 5 de cada categoría, de un vistazo. Toca una para explorarla a fondo.
| # | Modelo | Tendencia | Premios |
|---|
Ranking en barras
Mapa de valor
La carrera, día a día
Reinado del #1
Quién ha ocupado el primer puesto y durante cuántos días.
Movimientos de la semana
Cambio de posición frente a hace 7 días.
Laboratorios
//Panorama: la carrera completa
Las ocho categorías a la vez. Quién domina cada una hoy y quién ha ocupado el primer puesto desde que llevamos registro.
¿Quién domina cada categoría?
Mejor posición de cada laboratorio por categoría. Más intenso = más arriba. Toca una celda para ir a esa categoría.
La carrera por el #1
Cada franja es un reinado: el modelo que ocupó el primer puesto y por cuántos días.
//Metodología
Transparencia total: así se construye este ranking.
¿Cómo leer esta tabla?
¿Cómo leer los gráficos?
Tabla: el detalle completo, fila por fila. Barras: el mismo ranking dibujado a escala, para ver de un vistazo cuánta distancia hay entre uno y otro (en agéntico, la barra se parte en sus dos pruebas). Mapa: cada punto es un modelo según su precio y su calidad; arriba a la izquierda está lo bueno y barato, y la línea punteada es la frontera de Pareto (nadie ofrece más por menos). Evolución: la posición de cada modelo día a día — cuando una línea sube, el modelo escala puestos. En ⚡ Velocidad el mapa cruza tokens por segundo con precio o con inteligencia, porque ahí el trade-off es rapidez contra cerebro. Laboratorios: cada fila es una empresa y cada punto uno de sus modelos, para ver quién tiene el mejor modelo y quién tiene más modelos competitivos.
El historial parte del 22 de julio de 2026, cuando empezamos a guardar una foto diaria del ranking. Si la metodología de una categoría cambia (como el índice agéntico el 26 de septiembre de 2026), el gráfico marca el corte y no compara posiciones de antes y después como si fueran la misma vara.
¿De dónde salen los datos?
Las puntuaciones provienen de Artificial Analysis, el evaluador independiente de referencia: para texto y código usamos sus índices (0–100, combinan los benchmarks más exigentes); para agentes, nuestro índice con su batería actual (Terminal-Bench 2.1 y τ²-Banking); para imagen, voz, música y video, el Elo de sus arenas, donde miles de personas votan a ciegas entre resultados de dos modelos. La velocidad (tokens por segundo y latencia hasta la primera palabra) también proviene de Artificial Analysis, medida en condiciones reales de API.
Los precios de texto, código, agentes y velocidad vienen de la misma fuente y se muestran con entrada y salida por separado (USD por millón de tokens), porque casi todas las APIs cobran distinto por lo que envías y por lo que el modelo responde; para ordenar el Valor y el mapa usamos la mezcla estándar 3:1. Los precios de imagen, voz, música y video son tarifas de lista oficiales de cada proveedor, revisadas por el equipo de IA Lab. Como segunda fuente independiente, validamos texto, imagen y video contra el leaderboard público de LMArena: cuando un modelo aparece en su top 10, mostramos su Elo de Arena junto al creador.
¿Cómo se calcula el Valor?
El Valor responde una sola pregunta: ¿cuánta inteligencia recibes por cada dólar? La fórmula es calidad² ÷ √precio, reescalada para que el mejor equilibrio de cada categoría sea 100. Elevar la calidad al cuadrado premia a los modelos realmente buenos (no gana el más mediocre solo por ser regalado) y la raíz del precio evita que un modelo carísimo se hunda si su calidad lo justifica. El sello Sweet spot se otorga a los modelos eficientes: nadie ofrece más calidad por menos dinero (frontera de Pareto) y su Valor es alto (≥ 60).
Cada categoría incluye a los 30 mejores por calidad y los 20 mejores por Valor (sin duplicados, fusionando variantes de configuración del mismo modelo): así las joyas baratas-brillantes compiten junto a los gigantes, en vez de quedar fuera por no estar en el top absoluto de inteligencia. Los modelos con precio $0 reciben el sello Gratis y un Valor con barandas para que no inunden el podio.
¿Por qué no promediamos las dos fuentes? Porque Arena solo publica su top 10: combinar ambas puntuaciones premiaría o castigaría únicamente a esos pocos modelos y dejaría al resto medido con otra vara — un sesgo de cobertura clásico. Ordenamos con la fuente de cobertura completa (Artificial Analysis) y usamos Arena como contraste visible: cuando ambas coinciden en la cima, la señal es robusta; cuando divergen, el lector lo ve y juzga por sí mismo.
Unidades de precio por categoría
Texto, código, agentes y velocidad: USD por 1 millón de tokens, entrada y salida por separado (la mezcla 3:1 se usa solo para calcular el Valor) · Imagen: USD por imagen (~1024 px) · Voz: USD por 1 millón de caracteres · Música: USD por canción (~3 min) · Video: USD por segundo generado. Son tarifas de lista de las API oficiales; los proveedores pueden cambiarlas y algunos modelos solo se ofrecen por suscripción (se indica el equivalente estimado).
Datos abiertos y estado de la fuente
El sitio carga primero un snapshot publicado con la página y luego consulta la fuente en vivo; si la fuente no responde, verás el snapshot con su fecha. Nunca se muestran datos ficticios.
Descarga los datos: ranking de hoy (JSON) · historial de posiciones (JSON) · o el CSV de cada categoría desde el menú de filtros. Licencia CC BY 4.0: cita a IA Lab.