La expansión de la inteligencia artificial generativa está obligando a revisar algunas de las reglas que durante décadas parecían implícitas en Internet. Una de las principales tiene que ver con el uso de información disponible públicamente: que un contenido pueda encontrarse online no significa necesariamente que pueda ser utilizado sin restricciones, especialmente cuando ese material termina alimentando modelos de inteligencia artificial capaces de generar productos que compiten con sus autores originales.
Ese fue uno de los ejes centrales de la charla que Valeska Kraus, abogada especializada en Derecho Informático, brindó durante Nerdearla Argentina 2026. En diálogo con ITSitio, la especialista explicó que el crecimiento de la IA generativa produjo un cambio significativo respecto de la forma en que se recolectan y utilizan datos, código y contenidos disponibles en la web.
Durante años, el scraping fue utilizado para recolectar información pública con distintos objetivos. Sin embargo, Kraus señaló que la escala y el propósito que adquirió esta práctica con la inteligencia artificial modificaron sustancialmente el escenario. “Cambió el paradigma por la cantidad de datos que se procesan y la utilización, el para qué se recolectan los datos”, explicó.
Para la abogada, uno de los principales problemas está en la dificultad para determinar de dónde proviene la información que termina siendo utilizada para entrenar un modelo. La enorme cantidad de datos procesados hace que se vuelva cada vez más complejo rastrear su origen y determinar qué derechos existían sobre ellos. “Se procesa tantos datos por minuto que no sabés de dónde vienen esos datos, y hay una desprotección de los autores por parte de la inteligencia artificial”, sostuvo.
El conflicto, además, no se limita al entrenamiento de los modelos. Según Kraus, la diferencia fundamental respecto de las prácticas tradicionales de Internet está en el resultado que se obtiene a partir de esa información. Los sistemas de IA pueden procesar contenidos y generar productos capaces de competir directamente con quienes produjeron los materiales originales. “La inteligencia artificial con esos datos hace, justamente, productos que compiten directamente con nosotros. Y nos afectan directamente”, afirmó.
El código también tiene dueño
Uno de los puntos centrales de la exposición estuvo relacionado con el software y las licencias de código abierto. Kraus recordó que el hecho de que un código esté disponible públicamente no implica que haya quedado liberado de derechos de autor. Por el contrario, el código fuente está protegido y su utilización depende de las condiciones establecidas por la licencia correspondiente.
La diferencia resulta especialmente importante en el caso de las licencias copyleft. Estas permiten utilizar, modificar y distribuir código bajo determinadas condiciones, entre ellas que las modificaciones y desarrollos derivados mantengan determinadas libertades. Por eso, utilizar código abierto para desarrollar un producto cerrado puede generar un conflicto con los términos bajo los cuales ese código fue publicado.
En la entrevista, Kraus fue contundente al señalar dónde se encuentran actualmente algunos de los principales límites legales para las empresas que utilizan scraping para alimentar sistemas de IA: “En las licencias”.
En ese sentido, explicó que la discusión no pasa únicamente por determinar si un contenido puede ser técnicamente recolectado, sino por analizar qué se hace posteriormente con esa información. “Se puede usar para entrenar el modelo, pero el tema es qué hacés vos con eso”, indicó.
La especialista utilizó como ejemplo el caso de MySQL, que durante años combinó diferentes modelos de licenciamiento. La empresa ofrecía una versión abierta y otra comercial, lo que permitía a determinados usuarios mantener modificaciones de manera privada bajo las condiciones correspondientes. “Un producto era abierto y un producto era cerrado”, recordó Kraus, y aclaró que la protección del copyleft se aplica cuando se utiliza el código que efectivamente está sujeto a esa licencia.
Fair use y una legislación argentina diferente
Otro de los grandes debates abordados durante la charla fue el concepto de fair use, particularmente relevante en Estados Unidos. Esta figura permite analizar determinados usos de obras protegidas a partir de factores como el propósito de la utilización, su carácter comercial o transformativo, la naturaleza de la obra, la cantidad utilizada y el impacto sobre el mercado original.
Los litigios que involucran a empresas como OpenAI, Anthropic, Meta y GitHub muestran que todavía existen importantes zonas grises respecto de cuándo el entrenamiento de un modelo puede considerarse legítimo y cuándo puede constituir una infracción.
En Argentina, sin embargo, el escenario es diferente. El país no cuenta con una figura equivalente al fair use estadounidense, por lo que los conflictos deben analizarse principalmente a partir de las normas de propiedad intelectual, protección de datos y las condiciones contractuales aplicables.
Kraus también se refirió durante la entrevista a un caso argentino muy reciente relacionado con el diario Perfil y el uso de contenidos por parte de sistemas de inteligencia artificial. Según explicó, se trata de una causa reservada que fue iniciada aproximadamente un mes antes de la entrevista y que plantea cuestionamientos similares a los que aparecen en otros litigios internacionales.
“Es muy reciente”, aclaró la abogada, quien señaló que uno de los planteos estaría relacionado con la denominada “memorización” de contenidos y con el acceso indirecto a artículos que originalmente se encuentran detrás de barreras de pago.
¿Scrapear es ilegal?
Otro punto que Kraus buscó diferenciar es la relación entre scraping, propiedad intelectual, datos personales y delito informático. Recolectar información mediante scraping no constituye automáticamente un delito. La situación puede cambiar cuando la actividad implica vulnerar contraseñas, acceder indebidamente a sistemas, afectar servidores o cometer algún tipo de fraude.
También entran en juego las normas de protección de datos personales cuando la información recolectada incluye datos sensibles.
En este escenario aparecen herramientas como robots.txt y otros mecanismos destinados a indicar que un sitio no autoriza determinados tipos de crawlers o bots. Sin embargo, Kraus explicó que estas herramientas funcionan principalmente como señales o indicaciones y que no necesariamente generan por sí mismas una consecuencia jurídica.
El antecedente de LinkedIn y hiQ Labs también fue mencionado para mostrar la complejidad del problema: que determinada información sea públicamente visible no significa necesariamente que pueda utilizarse para cualquier finalidad.
La responsabilidad también alcanza a los usuarios
Para Kraus, la discusión no debe quedar limitada a las grandes compañías que desarrollan modelos de inteligencia artificial. Los usuarios y desarrolladores que incorporan estas herramientas a sus procesos también tienen responsabilidades.
“Los desarrolladores que utilizan ese tipo de herramientas también tienen una responsabilidad”, advirtió. La especialista señaló que algunas compañías incluso establecen restricciones específicas sobre el uso de IA para determinadas tareas de programación.
Por eso, recomendó mantener un criterio propio y contar con conocimientos suficientes para evaluar el código y los contenidos generados por estas herramientas. “Hay que tener en cuenta, si uno es usuario, para qué lo ocupa”, sostuvo.
La recomendación se extiende tanto a las licencias del código y los datos utilizados como a las condiciones de uso de las propias plataformas de IA. Para empresas y desarrolladores, revisar esos términos puede ser tan importante como evaluar la calidad técnica de una herramienta.
De cara al futuro, Kraus anticipa que el acceso a la información disponible en Internet podría volverse progresivamente más restrictivo. “Yo creo que sí, y más todavía, si no se le pone un freno a la inteligencia artificial, creo que los datos van a ser más reservados”, concluyó.
La discusión planteada en Nerdearla Argentina 2026 deja así una pregunta que excede a la tecnología: en una Internet donde la inteligencia artificial puede convertir prácticamente cualquier contenido público en materia prima para nuevos productos, ¿qué significa realmente que un dato sea público?
Leer más
- Las soluciones conectadas con Inteligencia Artificial de Samsung simplifican la rutina de quienes viven solos
- 75% de las empresas espera aumentar su inversión en IA este año, según Bain
- Mapas interactivos entre amigos e IA: así es la nueva forma de buscar y planear viajes en Airbnb