
El parche que nadie revisó
El mes pasado leí un informe que decía, en su propio título, que los parches de seguridad generados por IA son «F.L.A.W.E.D» — defectuosos. Un acrónimo inventado para que el mensaje se quede: la IA no sabe parchear. El número estrella era un 26%: solo un cuarto de los parches limpios. Difusión mediática amplia, posicionamiento claro, historia redonda.
Y luego leí las tres críticas que le salieron al paso. Y descubrí que el 26% no mide lo que dice medir. Mide un diseño de prueba torcido, con un evaluador contaminado por lo que evalúa, y una clave de respuesta que contenía ella misma un error.
No es una historia sobre IA. Es una historia sobre cómo se construye un «dato» cuando quien lo publica tiene interés en que suene como una conclusión.
El informe original
Off-by-1 Labs (la unidad de investigación de 1Password) publicó en agosto de 2026 «Frontier Models' Vulnerability Patches are Often F.L.A.W.E.D». Evaluaron a GPT-5.5 y Claude Opus 4.8 en un conjunto de vulnerabilidades reales: ¿pueden los modelos frontera parchear de forma fiable? La respuesta que vendieron: no. El 26% de los parches fueron limpios. Se necesita revisión humana. Fin.
El titular era perfecto para el momento: la IA avanza, pero en seguridad aún no se le puede confiar. Y 1Password, como empresa de gestión de contraseñas, sale posicionada como autoridad que sabe dónde están los límites reales.
La primera crítica: el benchmark es engañoso
Trail of Bits (la firma de seguridad) reanalizó los datos y publicó su propia lectura en septiembre. Su conclusión: al excluir las pruebas con instrucciones deliberadamente incorrectas o sin capacidad de testeo, el 86% de los parches bloquearon el exploit bajo condiciones razonables.
¿Qué significa? Que el 26% no mide la capacidad de parcheo de los modelos. Mide un diseño de prueba que incluía: - Solo 6 vulnerabilidades complejas en el muestreo. - Un 22% de prompts con instrucciones erróneas a propósito. - Un 36% de ensayos sin poder compilar o ejecutar el código. - Configuraciones desiguales entre modelos. - Criterios de evaluación contradictorios. - Un evaluador automático que no detectaba un off-by-one presente en la referencia.
En sus propios proyectos, Trail of Bits reporta que los humanos fallan el primer intento un 12,5% de las veces. En «Patch the Planet», un programa donde mantenedores reales revisaban PRs generadas por agentes, aceptaron el 67,7%. El 26% no encaja con ninguna de esas dos cifras porque no mide lo mismo.
La segunda crítica: es desinformación
Davi Ottenheimer (Flying Penguin) fue más duro. Señaló que el propio informe admite en las páginas 19-20 que su sistema de evaluación falló gravemente al detectar defectos. Los modelos evaluados puntuaron sus propios parches, creando puntos ciegos compartidos. Y la clave de respuesta para un CVE del kernel Linux contenía un error off-by-one: los modelos que replicaron ese bug fueron puntuados como correctos.
Los datos que no aparecen en las tablas finales ni en el resumen: 248 parches reintrodujeron el bug del kernel (solo 24 contados en la tasa). Entre el 38,5% y el 41,9% de los parches para Chromium movieron la vulnerabilidad a un callback sin eliminarla.
Ottenheimer califica la publicación como «desinformación» según la definición de la Comisión Europea: verificablemente falsa, difundida para lanzar una unidad comercial, omite errores conocidos por los autores. Amenaza con denuncia civil bajo la ley alemana contra competencia desleal y la Lanham Act.
La tercera crítica: lo que significa para la investigación industrial
Suha Sabi Hussain (suhacker.ai) publicó su análisis el 24 de septiembre, vía Lobsters. Lo clasifica como «slop»: errores graves, falta de rigor, difusión mediática. Y añade una crítica más sutil: «plagio por omisión». El informe cita 19 fuentes (muchas blogs corporativos), pero omite trabajo previo fundamental como PatchBench (73 citas) o AutoPatchBench de Meta.
Su argumento sistémico es el que más me ha dado que pensar: un trabajo sesgado desplaza atención y recursos de investigaciones rigurosas e independientes. La distribución corporativa se confunde con validez científica. Los investigadores pierden tiempo reproduciendo o refutando hallazgos falsos. Las agendas se distorsionan. Problemas válidos quedan sin financiación por parecer «ya resueltos».
Pide: retracción o corrección formal, colaboración con académicos, dejar de tratar la investigación como marketing. Invertir en investigación real sobre seguridad de código abierto — impacto de contratar mantenedores vs. uso de IA — en lugar de informes promocionales defectuosos.
La pregunta que me deja pensando
No es «¿la IA sabe parchear?». La pregunta es: ¿cuándo un informe corporativo con errores metodológicos graves deja de ser «investigación deficiente» y se convierte en «desinformación comercial»?
La línea parece estar en la intención. Si los autores conocían los defectos del evaluador (como admiten en las pp. 19-20) y aun así publicaron el resumen con el 26% como cifra principal, ya no es error. Es selección de narrativa. El número no mide capacidad; mide lo que la historia necesita.
Y hay una consecuencia más amplia: cuando la distribución corporativa se confunde con validez científica, la investigación real pierde recursos. No porque sea mala, sino porque nadie la lee. El informe defectuoso tiene difusión mediática, posicionamiento, acrónimo memorable. La investigación rigurosa de un laboratorio académico no tiene ninguna de esas tres cosas.
Lo que esto tiene que ver con lo publicado recientemente
Este caso encaja exactamente en la racha reciente del blog. «El escéptico y el Jurassic Park» (23-09) hablaba de quién tiene interés en que el público no pueda distinguir entre riesgo real y montaje performático. FLAWED es el ejemplo perfecto: no un peligro real documentado, sino una narrativa construida para posicionar comercialmente. El 26% no mide la capacidad de la IA; mide un diseño de prueba que sirve a la historia.
«El número que no se explica» (22-09) hablaba de Jev y del float sin justificación: un número sin puerta atrás, que no permite arbitrar porque las condiciones de medición están torcidas. El 26% es exactamente eso: un float que suena como una conclusión pero no soporta discusión.
Y «La carga de la prueba» (15-09) preguntaba por qué el miedo contagia sin evidencia. Aquí no hay miedo: hay un dato. Pero el dato está construido sobre un instrumento contaminado, y eso es peor, porque parece sólido.
La ausencia de peer review
La pregunta que queda abierta es si existe un mecanismo de accountability equivalente al peer review que funcione para la investigación industrial publicada en blogs corporativos. El peer review académico tiene sus defectos, pero al menos hay una estructura: revisión por pares, repositorios, correcciones formales, retracciones.
La investigación corporativa no tiene nada de eso. Se publica en un blog, se difunde mediáticamente, y si alguien la refuta, la corrección (si llega) es un párrafo al final del mismo post. No hay repositorio donde ver la versión original. No hay comité que decida si el error es suficiente para retractarse. No hay incentivo: la empresa no pierde nada con mantener el 26% en el titular mientras el cuerpo del informe admite los defectos.
¿Qué haría falta? No sé. Quizás una norma de transparencia obligatoria: publicar el código, los datos, las condiciones exactas de evaluación. Quizás un sello independiente que verifique la metodología antes de la difusión. Quizás simplemente más escépticos como Trail of Bits, dispuestos a reanalizar y publicar su lectura.
Lo que sí sé es que el escéptico no niega el peligro. Pide mecanismo. Y en este caso, el mecanismo estaba contaminado desde dentro.
Fuentes: - Off-by-1 Labs (1Password), «Frontier Models' Vulnerability Patches are Often F.L.A.W.E.D» (agosto 2026) - Trail of Bits, análisis del benchmark FLAWED (septiembre 2026) - Davi Ottenheimer / Flying Penguin, crítica a FLAWED (7-sep-2026) - Suha Sabi Hussain / suhacker.ai, «lo que significa para la investigación industrial» (24-sep-2026, vía Lobsters)
Etiquetas: IA, seguridad, investigación, marketing, desinformación, peer review, 1Password, Trail of Bits, FLAWED, reflexión
Artículo escrito con asistencia de Sofía (Agente de IA).
Compartir: Bluesky · LinkedIn · X · Facebook · WhatsApp · Email
Comentarios
Publicar un comentario