El crecimiento exponencial de la IA: tareas el doble de largas
METR observó que el horizonte de tareas de la IA se duplicó cada siete meses entre 2019 y 2025. Qué mide el estudio y qué implica para tu negocio.
La inteligencia artificial mejora con cada generación de modelos, pero las pruebas académicas habituales dicen poco sobre cuánto trabajo real puede asumir un sistema. El equipo de METR propuso una medida más práctica: cuánto tardaría un profesional humano en completar las tareas que un modelo resuelve de forma autónoma.
Una medida de trabajo real
METR llama horizonte temporal a la duración de las tareas que un modelo completa con una probabilidad determinada de éxito. Al ordenar los resultados obtenidos entre 2019 y 2025, los investigadores observaron que ese horizonte se había duplicado aproximadamente cada siete meses.
La tendencia no significa que todos los modelos mejoren al mismo ritmo ni que cualquier tarea pueda automatizarse. Describe el avance registrado en el conjunto de pruebas del estudio, centrado principalmente en tareas de desarrollo de software realizadas con ordenador.
Por qué un modelo puede aprobar un examen y fallar en un proyecto
Los modelos pueden resolver problemas de conocimiento, escribir código y superar algunas pruebas mejor que especialistas humanos. Sin embargo, pierden fiabilidad cuando una tarea exige mantener el contexto, usar varias herramientas y corregir errores durante horas.
Los datos del estudio muestran esa caída:
- En tareas que una persona resuelve en menos de 4 minutos, los mejores modelos se acercaban al 100% de éxito.
- En tareas de más de 4 horas, la tasa de éxito quedaba por debajo del 10%.

La duración humana funciona así como una medida aproximada de dificultad. Cuanto más tiempo necesita un profesional, más oportunidades tiene el modelo de perder información, elegir una herramienta equivocada o seguir un camino que no conduce al resultado.
Qué significa un horizonte de una hora
En la evaluación publicada en 2025, los modelos con mejores resultados, entre ellos Claude 3.7 Sonnet, alcanzaban un horizonte cercano a una hora con un umbral de éxito del 50%. Dicho de otro modo, completaban la mitad de las tareas que a un profesional le llevarían alrededor de una hora.
La cifra cambia cuando exiges mayor fiabilidad. Para automatizar un trabajo sin supervisión, un 50% de acierto resulta insuficiente; con umbrales más estrictos, el horizonte se reduce a unos pocos minutos. Esta diferencia explica por qué un modelo puede impresionar en una demostración y necesitar revisión humana en un flujo de trabajo real.
Qué permite proyectar la tendencia
Si el ritmo medido entre 2019 y 2025 continuara hasta el final de la década, los sistemas más avanzados podrían abordar proyectos que hoy requieren varias semanas de trabajo humano. Los autores calculan que incluso un error de medición de diez veces desplazaría la previsión unos dos años, debido a la pendiente de la tendencia.
Esta proyección no es una promesa. El estudio analiza un tipo concreto de tareas y no recoge todo lo que exige un proyecto empresarial: negociar prioridades, interpretar información ambigua, coordinar personas o asumir responsabilidad por una decisión.
Cómo usar este dato en tu empresa
- Empieza por tareas acotadas que tengan una entrada, un resultado y un criterio de calidad claros.
- Mide el trabajo actual: tiempo empleado, errores y coste antes de introducir la IA.
- Prueba con revisión humana hasta conocer en qué casos falla el sistema.
- Revisa las capacidades cada pocos meses; el límite técnico cambia más rápido que muchos procesos internos.
El horizonte temporal ofrece una forma concreta de seguir el avance de la IA. Para una empresa, la decisión útil consiste en identificar qué tareas ya caben dentro de ese horizonte y cuáles siguen necesitando contexto, criterio y responsabilidad humana.
Basado en la investigación “Measuring AI Ability to Complete Long Tasks”
¿Quieres identificar qué tareas puedes automatizar con la tecnología actual? Reserva una sesión gratuita de 30 minutos.