¿Son fiables los detectores de IA? Lo que enseña el caso de la novela retirada del Goncourt

Universo Actual · 5 min de lectura
Manos sobre un teclado con texto en pantalla, en referencia a la escritura con inteligencia artificial
Foto: Dietmar Rabich / Wikimedia Commons (CC BY-SA 4.0)

Depende de la herramienta. Algunos detectores de texto generado por IA se equivocan con mucha frecuencia, sobre todo con personas que escriben en una lengua que no es la suya, mientras que un estudio reciente encontró uno muy preciso. Ninguno ofrece una prueba definitiva por sí solo.

En este artículo

El caso que puso a los detectores en el centro del debate

El 21 de septiembre de 2026, una cuenta anónima de la red social X, llamada «Balance ton Claude», publicó que la novela C’était ça ou mourir, del escritor haitiano-canadiense Thélyson Orélien, estaba escrita casi por completo con inteligencia artificial. Lo apoyaba en análisis de una herramienta llamada Pangram, que daba entre un 95 % y un 100 % de texto de IA en sus 35 capítulos. La novela había vendido 35.000 ejemplares, según Infobae.

Días después se supo que detrás de la cuenta estaba el ensayista Samuel Fitoussi, columnista de Le Figaro. El 25 de septiembre, la Academia Goncourt retiró el libro de su selección, alegando «resultados sistemáticos» de análisis según los cuales era «con toda probabilidad, en gran parte producto de la inteligencia artificial». Más tarde, el diario quebequés La Presse y Radio-Canada señalaron plagios en textos anteriores del autor, de 2012 y 2013.

Orélien niega haber usado IA. Su editorial afirma que empezó la novela en 2017 y terminó un borrador en 2019, antes de que existiera ChatGPT, y el autor denuncia haber recibido numerosos ataques racistas.

Cómo funciona un detector de IA

Un detector no «reconoce» a la máquina como reconoceríamos una firma. Lo que hace es medir rasgos estadísticos del texto y calcular una probabilidad. Los dos más usados son:

  • Perplejidad: mide qué tan previsible es cada palabra. Los modelos de IA tienden a elegir la continuación más probable, así que sus textos son más predecibles.
  • Variación (en inglés, burstiness): mide cuánto cambian la longitud y la estructura de las frases. Las personas suelen alternar frases cortas y largas; la IA tiende a ser más uniforme.

Además, muchas herramientas usan clasificadores entrenados con ejemplos de textos humanos y de IA. La propia empresa GPTZero, que fabrica uno de estos detectores, advierte que trabajan con probabilidades y no con certezas, que fallan más con textos editados o escritos en idiomas distintos del inglés, y que sus resultados deben combinarse con el criterio de una persona.

Cuando fallan: los casos documentados

El ejemplo más llamativo vino de la propia OpenAI, la empresa de ChatGPT. Lanzó su detector en enero de 2023 y lo retiró el 20 de julio de ese año por su «baja precisión»: solo identificaba correctamente el 26 % de los textos escritos por IA y marcaba como IA el 9 % de los escritos por personas.

Ese mismo mes, investigadores de la Universidad Stanford publicaron en la revista Patterns un estudio que probó siete detectores con 91 redacciones del examen de inglés TOEFL, escritas por estudiantes chinos. Más del 61 % fueron marcadas por error como textos de IA, mientras que las de estudiantes estadounidenses se clasificaron bien. La explicación: quien escribe en una lengua aprendida usa un vocabulario más limitado y frases más previsibles, justo lo que el detector asocia con una máquina.

RELACIONADO |  «La bola negra»: qué escribió Lorca y qué tuvo que imaginar la película de Los Javis

El mismo estudio mostró el problema contrario: bastó pedir a ChatGPT un lenguaje «más literario» para que la detección cayera casi a cero.

Errores comunes: ni todos fallan ni ninguno es una prueba

«Todos los detectores son inútiles». No exactamente. Un estudio de Brian Jabarian y Alex Imas, de la Universidad de Chicago, publicado en noviembre de 2025, comparó cuatro herramientas. Pangram, la usada en el caso francés, tuvo tasas de error «esencialmente nulas» en textos medianos y largos, incluso cuando se usaron programas para hacer que el texto pareciera humano. Otras fallaron mucho más: un detector de código abierto dio entre un 30 % y un 78 % de falsos positivos, y GPTZero no detectó cerca de la mitad de los textos «humanizados».

«Si el detector dice IA, está probado». Tampoco. Los propios autores del estudio de Chicago desaconsejan usar muchas de estas herramientas para poner notas o sancionar. Un resultado es un indicio que, como recomienda GPTZero, debe combinarse con el juicio de una persona y con otras comprobaciones, como las de plagio.

«Usar IA para corregir es hacer trampa». Jabarian, que no es hablante nativo de inglés, lo planteó así sobre usar estas herramientas para revisar la gramática: «¿Debería ser castigado por eso? En absoluto».

Para conocer otros límites de esta tecnología, aquí repasamos el uso de la inteligencia artificial en la justicia.

Preguntas frecuentes

¿Cómo sabe un detector si un texto lo escribió una IA?

Mide rasgos estadísticos, como qué tan previsibles son las palabras y cuánto varían las frases, y calcula una probabilidad. No ofrece una certeza.

¿Puede un detector de IA equivocarse con un texto humano?

Sí. Un estudio de Stanford encontró que siete detectores marcaron por error más del 61 % de las redacciones de estudiantes que escribían en una lengua aprendida.

¿Hay algún detector fiable?

Un estudio de la Universidad de Chicago de 2025 encontró que Pangram tenía errores casi nulos en textos medianos y largos, pero otras herramientas fallaban mucho. Ningún resultado debería usarse como prueba única.

El caso de la novela francesa seguirá dando que hablar, y editores, profesores y jurados tendrán que decidir qué peso dan a estas herramientas. Lo que muestran los estudios es que conviene saber qué detector se usa, con qué tipo de texto y con qué margen de error, antes de sacar conclusiones sobre quién escribió qué.

Fuentes consultadas (6)