Las empresas de IA buscan libros y documentos humanos para entrenar a sus modelos pero, el negocio abre una nueva disputa por el conocimiento sobre quién lo posee.
Las empresas de inteligencia artificial (IA) regresan a las bibliotecas y librerías en busca de libros escritos por humanos y mientras que internet se llena de contenido generado por máquinas, los textos producidos antes del auge de la IA generativa adquieren un nuevo valor para entrenar modelos.
Una investigación documentada por 404 Media mostró cómo empresas vinculadas con la industria de la IA recurren a libros antiguos que se escanean para convertirlos en datos de entrenamiento, pero el debate no solo es sobre los derechos de autor o la conservación del patrimonio, sino también sobre qué tipo conocimiento está entrando a los modelos.
Patricia Murrieta, investigadora del Tecnológico de Monterrey y especialista en el estudio de la relación entre tecnología, historia y conocimiento, menciona que el valor de los libros para la IA envuelve la parte de que son una fuente de información producida por humanos, por lo que los modelos generativos también pueden entrenarse con datos sintéticos, información producida o procesada por otras herramientas de IA. “El problema aparece cuando estos datos vuelven a alimentar los modelos que pueden contener errores, alucinaciones o información sin un control editorial”, afirma.
La investigadora recalca que los datos de calidad suelen partir de algo llamado “ground truth”, información verificada y certera, categoría en la que entran los libros, artículos y otros materiales producidos por personas, inclusive, el hecho de que un texto haya sido escrito por un humano no significa que sea neutral.
“Los documentos siempre tienen una función que tiene que ver con los intereses de quien escribe y hacia quien va a dirigir”, explicó Patricia Murrieta, pues la diferencia es que, en una investigación histórica tradicional, el especialista conoce ese problema, un historiador no solo lee el documento sino que intenta entender quien lo produjo, en qué momento, con qué intención, y desde qué perspectiva.
Asimismo, los modelos generativos funcionan como cajas negras donde, una vez que grandes cantidades de información entran en ellas, resulta complicado identificar qué parte de una respuesta proviene de una fuente específica y la información se convierte en representaciones matemáticas para que, posteriormente, el sistema genere respuestas a partir de relaciones probabilísticas.
null
Patricia Murrieta coloca como ejemplo la historia de México ya que durante décadas el acceso de los investigadores a determinadas fuentes estuvo limitado por la cantidad de documentos existentes y los conocimientos especializados necesarios para analizarlos como la paleografía mientras que la inteligencia artificial puede cambiar esa escala.
“La inteligencia artificial nos ayuda a visibilizar y traer discursos que antes era imposible traer simplemente por la escala enorme”, comentó Murrieta. Por otro lado, la tecnología también puede amplificar los desequilibrios existentes como un experimento realizado por la investigadora del Tec donde le pidió al modelo representar a una mujer mexica y el resultado fue una mujer blanca, sexualizada, y acompañada de elementos estereotípicos asociados desde una mirada occidental con la cultura mexica, por lo que el problema no era solo la imagen sino que el modelo la representaba como una imagen correcta.
Este ejemplo muestra cómo la IA no solo depende de la cantidad de información disponible, sino de quien la produce, qué culturas, idiomas y qué perspectivas. Esto es relevante para América Latina ya que históricamente ha producido enormes cantidades de conocimiento pero no tiene el mismo peso que las grandes tecnológicas en Estados Unidos o China.
Por eso, el hecho de introducir más documentos latinoamericanos a los sistemas de IA puede ser una oportunidad para ampliar la representación del conocimiento pero se plantean cuestiones como: quién recopila esos materiales, bajo qué reglas y con qué propósitos. De esta forma, la investigación histórica puede beneficiarse de esa escala sin renunciar al criterio humano.
“El primer filtro debe ser el pensamiento crítico de la persona que está utilizando y desarrollando la IA como una herramienta, jamás como una sustitución de la capacidad y la interpretación crítica”, mencionó Murrieta.
expansión







