IA Lab Ranking Cargando datos…
Observatorio independiente de modelos de IA

Los modelos de IA más poderosos.
Y cuánto valen de verdad.

Ocho categorías —texto, código, agentes, velocidad, imagen, voz, música y video—, quién manda en cada una, qué cuesta, dónde está el sweet spot y cómo se ha movido la carrera día a día. En tabla, en barras, en mapa o en el tiempo: tú eliges cómo leerlo. Benchmarks independientes, actualizados cada día a las 6:00 am.

—
Modelos evaluados
—
Categorías
—
Días de historial
—
Sweet spots hoy

//Hoy en el ranking

El top 5 de cada categoría, de un vistazo. Toca una para explorarla a fondo.

— lídermejor valormás barato / gratissweet spot
# Modelo Tendencia Premios

//Panorama: la carrera completa

Las ocho categorías a la vez. Quién domina cada una hoy y quién ha ocupado el primer puesto desde que llevamos registro.

¿Quién domina cada categoría?

Mejor posición de cada laboratorio por categoría. Más intenso = más arriba. Toca una celda para ir a esa categoría.

La carrera por el #1

Cada franja es un reinado: el modelo que ocupó el primer puesto y por cuántos días.

Cargando el historial…

//Metodología

Transparencia total: así se construye este ranking.

¿Cómo leer esta tabla?
¿Cómo leer los gráficos?

Tabla: el detalle completo, fila por fila. Barras: el mismo ranking dibujado a escala, para ver de un vistazo cuánta distancia hay entre uno y otro (en agéntico, la barra se parte en sus dos pruebas). Mapa: cada punto es un modelo según su precio y su calidad; arriba a la izquierda está lo bueno y barato, y la línea punteada es la frontera de Pareto (nadie ofrece más por menos). Evolución: la posición de cada modelo día a día — cuando una línea sube, el modelo escala puestos. En ⚡ Velocidad el mapa cruza tokens por segundo con precio o con inteligencia, porque ahí el trade-off es rapidez contra cerebro. Laboratorios: cada fila es una empresa y cada punto uno de sus modelos, para ver quién tiene el mejor modelo y quién tiene más modelos competitivos.

El historial parte del 22 de julio de 2026, cuando empezamos a guardar una foto diaria del ranking. Si la metodología de una categoría cambia (como el índice agéntico el 26 de septiembre de 2026), el gráfico marca el corte y no compara posiciones de antes y después como si fueran la misma vara.

¿De dónde salen los datos?

Las puntuaciones provienen de Artificial Analysis, el evaluador independiente de referencia: para texto y código usamos sus índices (0–100, combinan los benchmarks más exigentes); para agentes, nuestro índice con su batería actual (Terminal-Bench 2.1 y τ²-Banking); para imagen, voz, música y video, el Elo de sus arenas, donde miles de personas votan a ciegas entre resultados de dos modelos. La velocidad (tokens por segundo y latencia hasta la primera palabra) también proviene de Artificial Analysis, medida en condiciones reales de API.

Los precios de texto, código, agentes y velocidad vienen de la misma fuente y se muestran con entrada y salida por separado (USD por millón de tokens), porque casi todas las APIs cobran distinto por lo que envías y por lo que el modelo responde; para ordenar el Valor y el mapa usamos la mezcla estándar 3:1. Los precios de imagen, voz, música y video son tarifas de lista oficiales de cada proveedor, revisadas por el equipo de IA Lab. Como segunda fuente independiente, validamos texto, imagen y video contra el leaderboard público de LMArena: cuando un modelo aparece en su top 10, mostramos su Elo de Arena junto al creador.

¿Cómo se calcula el Valor?

El Valor responde una sola pregunta: ¿cuánta inteligencia recibes por cada dólar? La fórmula es calidad² ÷ √precio, reescalada para que el mejor equilibrio de cada categoría sea 100. Elevar la calidad al cuadrado premia a los modelos realmente buenos (no gana el más mediocre solo por ser regalado) y la raíz del precio evita que un modelo carísimo se hunda si su calidad lo justifica. El sello Sweet spot se otorga a los modelos eficientes: nadie ofrece más calidad por menos dinero (frontera de Pareto) y su Valor es alto (≥ 60).

Cada categoría incluye a los 30 mejores por calidad y los 20 mejores por Valor (sin duplicados, fusionando variantes de configuración del mismo modelo): así las joyas baratas-brillantes compiten junto a los gigantes, en vez de quedar fuera por no estar en el top absoluto de inteligencia. Los modelos con precio $0 reciben el sello Gratis y un Valor con barandas para que no inunden el podio.

¿Por qué no promediamos las dos fuentes? Porque Arena solo publica su top 10: combinar ambas puntuaciones premiaría o castigaría únicamente a esos pocos modelos y dejaría al resto medido con otra vara — un sesgo de cobertura clásico. Ordenamos con la fuente de cobertura completa (Artificial Analysis) y usamos Arena como contraste visible: cuando ambas coinciden en la cima, la señal es robusta; cuando divergen, el lector lo ve y juzga por sí mismo.

Unidades de precio por categoría

Texto, código, agentes y velocidad: USD por 1 millón de tokens, entrada y salida por separado (la mezcla 3:1 se usa solo para calcular el Valor) · Imagen: USD por imagen (~1024 px) · Voz: USD por 1 millón de caracteres · Música: USD por canción (~3 min) · Video: USD por segundo generado. Son tarifas de lista de las API oficiales; los proveedores pueden cambiarlas y algunos modelos solo se ofrecen por suscripción (se indica el equivalente estimado).

Datos abiertos y estado de la fuente

El sitio carga primero un snapshot publicado con la página y luego consulta la fuente en vivo; si la fuente no responde, verás el snapshot con su fecha. Nunca se muestran datos ficticios.

Descarga los datos: ranking de hoy (JSON) · historial de posiciones (JSON) · o el CSV de cada categoría desde el menú de filtros. Licencia CC BY 4.0: cita a IA Lab.