En resumen: Un puntaje de benchmark no es un dato sobre un modelo. Es un dato sobre un modelo corriendo bajo un presupuesto de razonamiento específico, un nivel de esfuerzo, una configuración de herramientas y un número de repeticiones. Los laboratorios publican todo eso en notas al pie que casi nadie lee. Aprende a leer la nota al pie y la mayoría de las promesas de los proveedores se vuelven fáciles de evaluar.
La respuesta en una línea: Cada benchmark de las tablas de anuncio mide una sola cosa, muy específica, y saber cuál es marca la diferencia entre comprar capacidad y comprar un titular.
Cada pocos meses uno de los grandes laboratorios lanza un modelo, y el anuncio trae una tabla. Ocho o doce filas, cada una con un nombre como SWE-bench Verified, τ2-bench o MRCR, cada una con un porcentaje al lado, y casi siempre con la columna del modelo nuevo en negritas.
La mayoría de la gente mira la columna en negritas y sigue de largo. Es una reacción razonable frente a una tabla que no tienes cómo interpretar.
Este texto es esa interpretación. No de todo el campo de la evaluación de IA, que es enorme, sino de la lista concreta de pruebas que Anthropic y OpenAI le ponen enfrente a un comprador cuando lanzan algo. Esa lista es finita, tiene alrededor de veinte entradas, y cada una responde una pregunta lo bastante acotada como para explicarla en una frase.
Nuestro interés en esto no es académico. En ClickWerxs construimos flujos de trabajo con IA para negocios de clientes, lo que implica elegir modelos, y la distancia entre lo que mide un benchmark y lo que un cliente necesita es justo donde los proyectos se tuercen.
¿Qué contiene realmente la tabla de benchmarks de un anuncio?
Una lista corta de pruebas con nombre propio, cada una midiendo una capacidad, elegidas por el laboratorio.
El anuncio de Claude Opus 4.5 incluyó siete: SWE-bench Verified, SWE-bench Multilingual, Aider Polyglot, BrowseComp-Plus, Vending-Bench, τ2-bench y Terminal-Bench. Once meses después, el anuncio de Opus 4.6 traía un conjunto más largo: Terminal-Bench 2.0, Humanity's Last Exam, GDPval-AA, BrowseComp, MRCR v2, SWE-bench Verified, MCP Atlas, ARC-AGI-2, CyberGym, OpenRCA, BigLaw Bench y Vending-Bench 2.
Las tablas de OpenAI se cruzan con esas y también se separan: GPQA Diamond, AIME, MMMU, HealthBench, BFCL, MMLU-Pro, SciCode, FrontierMath y GDPval aparecen a lo largo de sus lanzamientos.
Fíjate en lo que eso significa. La lista es una decisión. Un laboratorio incluye los benchmarks donde su modelo sale bien parado y donde cree que están mirando los compradores, y descarta los que ya dejaron de separar a un modelo de otro. Ninguna de las dos cosas es deshonesta. Las dos cambian lo que deberías concluir de la tabla.
¿Por qué el mismo benchmark da números distintos en lugares distintos?
Porque un puntaje depende de una configuración, y esa configuración vive en la nota al pie.
Esta es la nota metodológica del anuncio de Claude Opus 4.5, citada completa: "Todas las evaluaciones se corrieron con un presupuesto de razonamiento de 64K, blocs de notas intercalados, ventana de contexto de 200K, esfuerzo predeterminado (alto), parámetros de muestreo predeterminados (temperature, top_p), y promediadas sobre 5 corridas independientes". SWE-bench Verified fue la excepción y corrió sin ningún presupuesto de razonamiento. Terminal-Bench corrió con 128K.
Para el anuncio de Opus 4.6, SWE-bench Verified se promedió sobre 25 corridas. Humanity's Last Exam, que es un benchmark de conocimiento, se corrió con búsqueda web, obtención de páginas, ejecución de código, llamado programático de herramientas, compactación de contexto y hasta 3M de tokens de contexto total.
Vuelve a leer esa última parte. Una prueba de lo que un modelo sabe, evaluada con el internet abierto.
Esto no es un escándalo. Correr un benchmark de investigación difícil con herramientas es una decisión defendible, y Anthropic la publicó con claridad. Pero sí significa que el número mide capacidad de investigación con acceso a herramientas, y quien lo lea como conocimiento puro se llevó la conclusión equivocada.
El número de corridas importa igual y recibe menos atención. Promediar sobre 25 corridas da un número distinto que promediar sobre 5, y ambos difieren de una sola corrida, que es lo que reciben tus usuarios. Un modelo que acierta el 80% de las veces en promedio falla una tarea de cada cinco para la persona que lo tiene enfrente.
La variable más grande ni siquiera está en la nota al pie. Es el scaffold: el andamiaje de código que envuelve al modelo para que pueda leer archivos, correr pruebas y reintentar. OpenAI publicó el rango en su documento sobre SWE-bench Verified: el puntaje de GPT-4 en SWE-bench Lite fue de 2.7% con un scaffold temprano basado en recuperación de información y de 28.3% con CodeR. El mismo modelo. Diez veces el puntaje.
Detente un momento en ese dato, porque reordena la tabla entera. Una diferencia de diez veces producida por ingeniería que no es el modelo significa que un puntaje mide el andamiaje tanto como mide lo que está adentro. El laboratorio construye uno bueno. Quien arme tu integración, tal vez no.
Tres preguntas convierten cualquier número de benchmark en algo que puedes usar. Qué configuración lo produjo. Sobre cuántas corridas se promedió. Si se aplicó el mismo scaffold a todos los modelos de la comparación.
¿Qué miden realmente los benchmarks de programación?
Si un modelo puede resolver un problema de software de principio a fin, que es una habilidad distinta de escribir código que se ve bien.
SWE-bench es la referencia central y merece el detalle. Presentado en 2023, contiene 2,294 problemas tomados de issues reales de GitHub y sus pull requests correspondientes, en 12 repositorios populares de Python. El modelo recibe un repositorio y la descripción de un problema, y tiene que editar el código para resolverlo. El éxito se determina corriendo las pruebas del propio repositorio. No hay crédito parcial ni criterio humano de por medio, y eso es lo que lo hace creíble.
Al momento de su publicación, el mejor modelo probado resolvió un 1.96% de los issues. Hoy los modelos de frontera reportan puntajes por encima del 80% en el subconjunto Verified. Ese recorrido es el dato más importante de toda la evaluación de IA y la razón por la que esta categoría se renueva sin parar.
SWE-bench Verified es la variante que cita casi todo anuncio, y la historia de por qué existe vale más que el puntaje. OpenAI puso a 93 desarrolladores de Python a revisar 1,699 muestras tomadas al azar del conjunto de prueba original, con tres revisores por muestra y quedándose con la calificación de severidad más alta entre ellos. Encontraron que un 38.3% de las muestras tenía descripciones del problema mal especificadas y un 61.1% tenía pruebas unitarias capaces de marcar como incorrectas soluciones válidas. Filtrar con esos criterios eliminó un 68.3% del benchmark y dejó las 500 muestras que se convirtieron en SWE-bench Verified.
Dos tercios del benchmark más famoso de la IA no estaban midiendo lo que decían medir.
Su propio ejemplo lo aterriza. Una tarea de scikit-learn pedía arreglar un parámetro copy que la biblioteca ignoraba. Para pasar, el modelo tenía que lanzar una advertencia de obsolescencia que el issue nunca mencionaba, con un mensaje de texto exacto que se había acordado en la discusión del pull request, discusión que el modelo no puede ver. Ninguna capacidad resuelve esa tarea.
El efecto sobre los puntajes fue grande y en la dirección esperable. GPT-4o sacó 16% en el SWE-bench original y 33.2% en Verified. El mismo modelo, el doble de puntaje, solo por eliminar tareas que eran imposibles.
Eso debería ajustar tu confianza en los benchmarks en general, y también debería subir tu confianza en quienes lo encontraron, porque la corrección se publicó en lugar de esconderse. El resto de la familia de programación se divide por tipo de tarea: Terminal-Bench le da al agente una terminal y califica con códigos de salida y diferencias de archivos, Aider Polyglot mide editar código existente en varios lenguajes en vez de escribir código nuevo, y SWE-bench Pro existe porque Verified es lo bastante chico como para memorizarse.
¿Qué miden realmente los benchmarks de agentes?
Si un modelo puede seguir siendo útil a lo largo de muchos turnos mientras respeta reglas, que es donde se rompen la mayoría de las implementaciones reales.
τ-bench es el que conviene entender, porque prueba justo lo que preocupa a un negocio. Un modelo actúa como agente con herramientas de API de un dominio específico, conversando con un usuario simulado, y tiene que completar la tarea respetando una política escrita. La calificación compara el estado final de la base de datos contra un estado objetivo anotado, así que el modelo tiene que hacer la cosa en lugar de decir que la hizo.
El hallazgo del documento original, publicado en junio de 2024 y hoy un resultado de referencia histórica, es la parte que vale la pena recordar. Los agentes de llamado de funciones más avanzados del momento completaron menos del 50% de las tareas, y con una inconsistencia tal que el pass^8 en el dominio de retail quedó por debajo del 25%. Esa métrica pregunta si el agente resuelve la misma tarea ocho de ocho veces. Tres cuartas partes del tiempo, no lo logró.
Los modelos de frontera han mejorado bastante desde entonces. El punto estructural sigue en pie: un puntaje promedio y un puntaje de consistencia son números distintos, y normalmente solo se publica uno.
Un agente que funciona casi siempre y falla de forma impredecible es una fábrica de tickets de soporte, y los promedios esconden eso por completo.
El resto de la familia cubre superficies distintas. BrowseComp mide encontrar información difícil de localizar en internet. MCP Atlas y BFCL miden llamar herramientas y funciones correctamente. Vending-Bench pone a un agente a operar un negocio durante un horizonte largo y observa si se desvía, más que si se equivoca. OSWorld sienta a un agente frente a un escritorio con mouse y teclado.
¿Qué miden realmente los benchmarks de razonamiento y conocimiento?
Si un modelo puede responder preguntas que resisten la búsqueda, sobre una escalera de dificultad que se reconstruye una y otra vez.
GPQA es el ejemplo limpio de un buen diseño. Tiene 448 preguntas de opción múltiple de biología, física y química, escritas por expertos de cada área y construidas para ser "Google-proof", es decir, resistentes a la búsqueda web. Eso no se afirma, se mide: expertos con doctorado en el área correspondiente sacaron 65%, mientras que personas capaces pero ajenas al área, con acceso libre a internet y más de 30 minutos por pregunta, sacaron 34%. El subconjunto Diamond es la parte más difícil, y es el que citan los anuncios.
Humanity's Last Exam se construyó cuando MMLU dejó de servir. Los modelos de frontera ya superaban el 90% en los benchmarks populares, y un benchmark saturado no dice nada sobre cuál modelo es mejor. HLE tiene 2,500 preguntas de más de 100 materias, aportadas por cerca de 1,000 especialistas de más de 500 instituciones en 50 países, con un conjunto privado reservado para detectar sobreajuste. Las preguntas que resultaron buscables durante un programa de recompensas por errores se eliminaron.
ARC-AGI mide otra cosa: qué tan eficientemente un sistema adquiere una habilidad que nunca ha visto. Sus tareas se apoyan en conocimiento básico y no en educación formal, y por eso resultan fáciles para una persona y difíciles para un modelo. Es también el único benchmark grande que trata el costo como parte del resultado: solo muestra sistemas por debajo de US$10,000 por corrida y su categoría de Kaggle limita el cómputo a US$50 para 120 tareas. El razonamiento es que comprar un puntaje con cómputo ilimitado no es lo mismo que ser inteligente, y un benchmark que ignora el costo te deja hacer exactamente eso.
Para quien compra tecnología en un negocio, ese eje de costo es la idea más aprovechable de todo este texto.
¿Qué miden los benchmarks de contexto, multimodalidad y dominio?
Si la capacidad anunciada sobrevive al contacto con una carga de trabajo realista.
El contexto largo es el caso más claro de un número que engaña. La ventana de contexto que anuncia un modelo es cuánto texto le puedes mandar. MRCR y los benchmarks de recuperación miden cuánto de eso el modelo realmente puede usar, y las variantes de múltiples agujas con 1M de tokens separan a modelos que declaran la misma ventana. Esta es la brecha que explica por qué la función de subir documentos se ve bien en el demo y decepciona en la tercera semana.
MMMU cubre razonamiento multimodal: 11,500 preguntas de exámenes universitarios, cuestionarios y libros de texto, en seis disciplinas, 30 materias y 183 subcampos, con gráficas, diagramas, mapas, tablas, partituras y estructuras químicas. Al publicarse, a finales de 2023 y como resultado de referencia histórica, los modelos más fuertes de entonces llegaron a 56% y 59% frente a preguntas que un estudiante universitario competente resuelve. Esa brecha se ha cerrado bastante, que es justamente el patrón del que trata todo este texto.
Los benchmarks de dominio son los más cercanos a una decisión de compra. HealthBench califica contra rúbricas escritas por médicos en lugar de opción múltiple. BigLaw Bench y CyberGym cubren trabajo legal y de seguridad. LegalBench-RAG evalúa la mitad de recuperación de la búsqueda legal, que es donde empiezan la mayoría de las fallas en producción. Si estás comprando IA para una industria específica, un benchmark vertical predice tu resultado mejor que cualquier puntaje general de la tabla.
¿Por qué todos los benchmarks terminan dejando de servir?
Porque una medida que se convierte en objetivo deja de ser una medida, y el ciclo es idéntico cada vez.
Un benchmark se publica y es difícil. Los laboratorios optimizan contra él. Los puntajes suben. El benchmark se satura, los modelos se agrupan a un par de puntos de distancia y ya no separa nada. Lo reemplaza un sucesor más difícil y el ciclo vuelve a empezar. MMLU le cedió el lugar a MMLU-Pro. GSM8K a MATH, después a AIME, después a FrontierMath. HumanEval a SWE-bench. SWE-bench Verified muestra los mismos síntomas, y por eso existe SWE-bench Pro.
La contaminación acelera todo esto. OpenAI lo dice sin rodeos sobre su propia evaluación de preparación: como SWE-bench se armó con material extraído de repositorios públicos de GitHub, los modelos grandes preentrenados con texto de internet "probablemente estén contaminados con las tareas". Un benchmark hecho con datos públicos empieza a filtrarse hacia los conjuntos de entrenamiento el día que se publica, y esa filtración es muy difícil de medir desde afuera.
La consecuencia práctica es contraintuitiva. Para cuando un benchmark es lo bastante famoso como para que un proveedor te lo cite, normalmente ya dejó de distinguir entre las opciones serias. Los benchmarks que de verdad informarían tu decisión son los que todavía no conoces.
Nos topamos con una versión de esto midiendo nuestro propio trabajo. Optimizando este blog para citación por IA, seguimos la métrica que todo el mundo sigue, las posiciones en Google, y se quedó plana. Los clics orgánicos de Google estuvieron cerca de cero. Mientras tanto, un solo artículo sobre el producto Issuing V2 de Square acumuló 932 citas de Bing AI entre variantes de consulta, y las citas de IA de todo el sitio pasaron de cero a un pico de 171 por día el 7 de mayo de 2026, para después estabilizarse entre 56 y 111 diarias.
La métrica principal decía que nada estaba funcionando. La métrica que importaba ya se había movido. Habríamos sacado la conclusión equivocada del número que todos miran, y la única razón por la que no pasó es que estábamos midiendo las dos.
Esa es la misma falla que invita una tabla de benchmarks, en otro terreno.
¿Cuál benchmark debería cambiar tu decisión?
Probablemente ninguno por sí solo, y los dos que más se acercan son los que miden trabajo económico en vez de capacidad.
GDPval es el intento de OpenAI de responder la pregunta real. Califica entregables (documentos, presentaciones, hojas de cálculo) contra trabajo producido por profesionales de la industria con un promedio cercano a 14 años de experiencia, con un subconjunto abierto de 220 tareas que abarca 44 ocupaciones en los nueve sectores más grandes del PIB de Estados Unidos. Anthropic ahora también reporta cifras de GDPval-AA, lo que lo convierte en lo más parecido a una vara común entre laboratorios. El trabajo de METR sobre horizonte temporal llega por el otro lado, midiendo la duración de tarea que un modelo completa con una tasa de éxito del 50%, una cifra que se ha venido duplicando aproximadamente cada siete meses.
Esos dos responden "¿puede hacer el trabajo?" en lugar de "¿sabe cosas?". Es una mejor pregunta.
Pero la respuesta honesta es que el benchmark que debería guiar tu decisión todavía no existe, porque nadie lo ha construido para tu negocio. Veinte tareas sacadas de tu propio trabajo, reservadas para que ningún proveedor las haya visto, corridas contra dos modelos preseleccionados y calificadas por alguien que sabe cómo se ve un buen resultado en tu operación. Eso toma una tarde y te va a decir más que la tabla completa del anuncio.
Los benchmarks de este texto siguen valiendo la pena. Te dicen en qué es probable que un modelo sea bueno y te dejan descartar opciones barato. Solo no dejes que tomen la decisión final.
Preguntas frecuentes
Si un laboratorio corre sus propias evaluaciones, ¿se puede confiar en los resultados?
En general sí. Los benchmarks son públicos y los mantienen terceros, y los resultados suelen reproducirlos organizaciones independientes como Epoch AI y Vals AI. El escepticismo útil es más acotado que "¿estarán mintiendo?". Es que un laboratorio reporta su modelo con su propio scaffold bien afinado, lo que representa un techo y no una expectativa. Pregunta qué produce un arnés neutral, y si alguien fuera del laboratorio reprodujo la cifra.
¿Qué es el "cómputo paralelo en tiempo de inferencia" y por qué aparece en las notas al pie?
Anthropic lo define como un método que agrega múltiples intentos del modelo y selecciona entre ellos. Sube los puntajes porque varios intentos le ganan a uno. Le importa a un comprador porque cuesta más por respuesta y puede no ser la configuración del producto que estás comprando. Cuando una nota al pie lo menciona, la cifra del titular y la cifra que viven tus usuarios son cifras distintas.
¿Los puntajes predicen cómo se va a comportar un modelo en mi trabajo real?
Débilmente, y mejor cuando el benchmark se parece a tu tarea. Los de programación predicen resultados de programación razonablemente bien porque corren pruebas reales. Los de conocimiento general predicen muy poco sobre un flujo de trabajo acotado. Los de dominio en tu industria quedan en medio. Por eso un conjunto reservado de tus propias tareas le gana a cualquier puntaje público.
¿Cada cuánto cambian estas tablas lo suficiente como para importar?
Seguido. Se agregan, se quitan y se reemplazan benchmarks entre lanzamientos, como muestra el paso de Terminal-Bench a Terminal-Bench 2.0 y de Vending-Bench a Vending-Bench 2. Revisa la página del anuncio vigente en lugar de confiar en una comparación escrita incluso hace unos meses, incluida esta.
¿Existe un benchmark para saber si un sistema de IA es seguro de implementar?
No uno solo, y conviene desconfiar de cualquier proveedor que sugiera lo contrario. Los benchmarks de capacidad miden lo que un modelo puede hacer, no lo que hará bajo presión adversaria ni en tu contexto regulatorio. La evaluación de seguridad es una disciplina aparte, cubierta en las fichas técnicas de los laboratorios, y no se reduce a un porcentaje en una tabla.
Si estás evaluando un proveedor de IA y su propuesta se apoya en una tabla de benchmarks, lo más rápido que puedes hacer es preguntar qué configuración produjo cada número y sobre cuántas corridas se promedió. Un proveedor que sabe responder vale la pena seguir escuchando. Más allá de eso, el ejercicio de las veinte tareas es de verdad una tarde de trabajo y es la única evaluación que refleja tu operación.
En ClickWerxs construimos flujos de trabajo con IA y AI SEO sobre esa base: midiendo lo que importa y no lo que es fácil de reportar. Conoce los servicios de IA de ClickWerxs o ponte en contacto.
Los benchmarks de este texto, de un vistazo
| Benchmark | Qué mide | |---|---| | SWE-bench Verified | Resolver 500 issues reales de GitHub validados por humanos; se califica con las pruebas del propio repositorio | | SWE-bench Multilingual / Pro | La misma tarea más allá de Python; Pro es la variante difícil y resistente a contaminación | | Terminal-Bench 2.0 | Completar tareas en una terminal de Linux; se califica con códigos de salida, diferencias de archivos y salida | | Aider Polyglot | Editar código existente en varios lenguajes, a diferencia de escribir código nuevo | | τ2-bench | Completar una tarea con un usuario simulado respetando una política escrita | | BrowseComp / -Plus | Localizar información difícil de encontrar en internet | | MCP Atlas / BFCL | Llamar herramientas y funciones correctamente | | Vending-Bench 2 | Coherencia en horizonte largo; si un agente se desvía a lo largo de una corrida extendida | | OpenRCA | Análisis de causa raíz | | GPQA Diamond | 448 preguntas de ciencia escritas por expertos y diseñadas para resistir la búsqueda web | | Humanity's Last Exam | 2,500 preguntas de frontera en más de 100 materias, con un conjunto privado reservado | | ARC-AGI-2 | Adquisición de habilidades en tareas desconocidas, con el costo por tarea como parte del resultado | | MMLU-Pro | El sucesor difícil de MMLU, después de que MMLU se saturó | | AIME / FrontierMath | Matemáticas de competencia y de nivel investigación | | MRCR v2 | Cuánto de la ventana de contexto anunciada el modelo puede recuperar de verdad | | MMMU | 11,500 preguntas multimodales de nivel universitario en 30 materias | | HealthBench | Respuestas médicas calificadas contra rúbricas escritas por médicos | | BigLaw Bench | Tareas de razonamiento legal | | CyberGym | Trabajo de seguridad y vulnerabilidades | | GDPval / GDPval-AA | Entregables profesionales reales en 44 ocupaciones, calificados contra trabajo de expertos |
Cada uno de estos tendrá su propio artículo detallado en esta serie. Los enlaces se irán agregando aquí conforme se publiquen.
La información sobre las empresas citadas en este artículo proviene de fuentes públicas disponibles a la fecha de publicación y está sujeta a cambios. ClickWerxs no está afiliada a las empresas mencionadas. Todas las afirmaciones comparativas están respaldadas, ver los enlaces de fuentes. Este texto refleja la opinión de un operador y no es asesoría legal, financiera ni profesional.
Fuentes
- Anthropic, "Claude Opus 4.5" — tabla de benchmarks y notas metodológicas (presupuesto de razonamiento de 64K, 5 corridas, SWE-bench Verified sin presupuesto de razonamiento, Terminal-Bench con 128K; definición de cómputo paralelo en tiempo de inferencia). anthropic.com (consultado el 28 de julio de 2026)
- Anthropic, "Claude Opus 4.6" — lista de benchmarks y notas metodológicas (SWE-bench Verified promediado sobre 25 corridas; HLE con búsqueda web, obtención de páginas, ejecución de código y hasta 3M de tokens; ARC-AGI-2 con presupuesto de razonamiento de 120k). anthropic.com (consultado el 28 de julio de 2026)
- Jimenez et al., "SWE-bench: Can Language Models Resolve Real-World GitHub Issues?" — 2,294 tareas, 12 repositorios de Python, el mejor modelo al publicarse resolvió 1.96%. arxiv.org/abs/2310.06770 (consultado el 28 de julio de 2026)
- Ficha del conjunto de datos SWE-bench Verified — 500 muestras validadas por humanos. huggingface.co (consultado el 28 de julio de 2026)
- Rein et al., "GPQA: A Graduate-Level Google-Proof Q&A Benchmark" — 448 preguntas; expertos 65%, no expertos con acceso web 34% tras más de 30 minutos. arxiv.org/abs/2311.12022 (consultado el 28 de julio de 2026)
- "Humanity's Last Exam" — 2,500 preguntas, más de 100 materias, cerca de 1,000 colaboradores de más de 500 instituciones en 50 países, conjunto privado reservado. agi.safe.ai (consultado el 28 de julio de 2026)
- Yao et al., "τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains" — menos del 50% de éxito para los agentes de llamado de funciones más avanzados; pass^8 por debajo del 25% en retail. arxiv.org/abs/2406.12045 (consultado el 28 de julio de 2026)
- Yue et al., "MMMU" — 11,500 preguntas, seis disciplinas, 30 materias, 183 subcampos, 30 tipos de imagen; GPT-4V 56% y Gemini Ultra 59% al publicarse. arxiv.org/abs/2311.16502 (consultado el 28 de julio de 2026)
- ARC Prize — eficiencia en adquisición de habilidades, conocimiento básico previo, costo por tarea como eje de evaluación, límite de visualización de US$10,000 y presupuesto de cómputo de US$50 para 120 tareas en Kaggle. arcprize.org y arcprize.org/leaderboard (consultado el 28 de julio de 2026)
- OpenAI, "GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks" — subconjunto abierto de 220 tareas, 44 ocupaciones, 9 sectores, profesionales con un promedio cercano a 14 años de experiencia. arxiv.org/abs/2510.04374 (enviado el 5 de octubre de 2025, consultado el 28 de julio de 2026)
- METR, "Measuring AI Ability to Complete Long Tasks" — horizonte temporal definido con una tasa de éxito del 50%, duplicándose aproximadamente cada 7 meses. metr.org (consultado el 28 de julio de 2026)
- OpenAI, "Introducing SWE-bench Verified" — 93 desarrolladores de Python revisando 1,699 muestras, tres revisores por muestra; 38.3% con descripciones mal especificadas, 61.1% con pruebas unitarias injustas, 68.3% filtrado en total; GPT-4o 16% en el original contra 33.2% en Verified; GPT-4 entre 2.7% y 28.3% en SWE-bench Lite según el scaffold. openai.com (consultado el 28 de julio de 2026)
Kaleb Dickhaut — Fundador, ClickWerxs Kaleb construyó ClickWerxs desde cero: del ISO de procesamiento de pagos a la plataforma Command Center y a la metodología de AI SEO con la que funciona este blog. Ha incorporado a cientos de pequeños negocios a sistemas de pagos y CRM. linkedin.com/in/kaleb-dickhaut
