Lo que escribes en un chat, y dónde acaba
Qué ocurre con el texto que se escribe en una herramienta de IA —procesamiento, conservación, entrenamiento y país donde se guarda—, por qué una cuenta personal y una de empresa no se rigen igual, y qué comprobar en los ajustes.
Lo que se escribe en una herramienta de IA sale de tu ordenador, llega a los servidores de un tercero y, a partir de ahí, puede tener cuatro destinos. Se usa para responderte. Se guarda durante un tiempo. Puede servir para entrenar modelos futuros. Y queda almacenado en un país, con sus leyes. Cada destino se gobierna por separado, y casi todos se deciden en unos ajustes que poca gente abre.
En Cómo elegir una herramienta digital dejo escrito que lo que dice el contrato sobre tus datos está por escrito y se puede leer. Este artículo explica qué buscar al leerlo, y cuelga de Qué es realmente la inteligencia artificial .
Primer destino: responderte
Cuando envías un mensaje, el modelo lo procesa junto con el resto de la conversación y produce una respuesta. A esa operación se le llama inferencia, y durante ella el modelo no cambia: usa lo que le has dado y lo olvida al cerrar la conversación, como cuento en El contexto es el recurso escaso .
El entrenamiento es otra cosa. Es el proceso, anterior y separado, en el que se ajustan los parámetros internos de un modelo a partir de grandes cantidades de texto. De él sale el modelo que después usa todo el mundo.
La frase «la IA aprende de lo que le escribes» mezcla las dos. En la conversación no aprende nada. Lo que puede ocurrir es que tu conversación se guarde y se use más adelante como material para entrenar un modelo nuevo. Son dos riesgos distintos y se desactivan en sitios distintos.
Hay otra cosa que no es ninguna de las dos, y que cada vez más herramientas incorporan: la memoria entre conversaciones. El producto guarda notas sobre ti —tu cargo, tus preferencias, asuntos que has mencionado— y las añade por su cuenta a conversaciones futuras. Es cómodo, y es información tuya almacenada en un sitio que conviene saber revisar y borrar.
Y otra más, deliberada y de otra escala: una organización puede ajustar un modelo con sus propios datos, lo que se conoce como fine-tuning. Eso es entrenamiento a propósito, con contrato y con un fin. Nada que ver con que tus mensajes acaben ahí sin que lo sepas.
Segundo destino: se guarda
El historial que ves en la pantalla está guardado en los servidores del proveedor, y lo que ves no es necesariamente todo lo que se conserva.
Borrar una conversación la quita de tu lista. Que desaparezca de los sistemas del proveedor, y cuándo, depende de sus condiciones: es habitual que se conserve un tiempo por motivos de seguridad o de prevención de abusos, que las copias de respaldo tengan su propio ciclo, y que una obligación legal —una orden judicial, por ejemplo— obligue a guardar lo que se creía borrado.
Dos detalles más que se olvidan con facilidad. En algunos productos, personas del proveedor pueden revisar conversaciones para evaluar la calidad o investigar un uso indebido, y las condiciones dicen cuándo. Y un enlace compartido es un documento público: cualquiera que lo tenga lo lee, y puede acabar donde no esperabas.
Tercer destino: entrenar un modelo
Aquí está la decisión que más pesa, porque es la que no tiene vuelta atrás sencilla.
Un modelo no guarda sus textos de entrenamiento como una biblioteca: guarda una versión estadística de sus regularidades, como explico en Qué hace un modelo de lenguaje, sin matemáticas . Pero la investigación ha demostrado que un modelo puede memorizar fragmentos literales de lo que vio y reproducirlos si se le pregunta de la manera adecuada, sobre todo cuando el texto aparecía repetido. El riesgo es pequeño para un mensaje concreto y no es cero.
Y hay algo más importante que la probabilidad: una vez un texto ha entrado en un entrenamiento, retirarlo del modelo resultante no es una operación sencilla. Borrar la conversación no deshace el entrenamiento que ya se hizo con ella. La decisión que cuenta es la de antes, y se toma en los ajustes.
En los productos de consumo es frecuente que el uso de las conversaciones para entrenar venga activado por defecto y haya que desactivarlo a mano. Las condiciones cambian con el tiempo y son distintas en cada producto, así que la única respuesta fiable es la de tu propia pantalla de ajustes, hoy.
Personal o de empresa: la diferencia que más pesa
La misma herramienta puede estar regida por dos contratos distintos, y de eso depende casi todo lo anterior.
Una cuenta personal —gratuita o de pago individual— se rige por las condiciones de consumo que acepta quien se registra. Ahí es donde suele estar el entrenamiento activado por defecto, y donde las decisiones sobre retención y memoria las toma cada persona en sus ajustes. Pagar una suscripción individual no la convierte en una cuenta de empresa.
Una cuenta de empresa se rige por un contrato que firma la organización. Lo habitual en ese nivel es que el proveedor se comprometa a no entrenar con los datos del cliente, que exista un acuerdo de tratamiento de datos, y que un administrador controle la retención, los conectores y quién accede a qué.
La consecuencia práctica es incómoda y conviene decirla claro: quien usa su cuenta personal para trabajar está sacando información de la empresa fuera de los contratos de la empresa, aunque lo haga con la mejor intención. Si ese texto incluye datos personales de la clientela o de la plantilla, además, la organización es responsable de ellos, y la protección de datos europea exige un contrato con quien los trata por su cuenta. Una cuenta personal no aporta ese contrato.
El Reglamento europeo de IA añade obligaciones según el nivel de riesgo de cada uso. Lo que se escribe en un chat, en cambio, lo sigue gobernando sobre todo la protección de datos.
Cuarto destino: un país y sus leyes
Los datos se procesan y se almacenan en algún sitio, y la ubicación determina qué ley se les aplica y quién puede reclamarlos.
Para una organización europea, que los datos se queden en la Unión simplifica el cumplimiento: sacar datos personales fuera de ella requiere que exista un mecanismo legal que lo permita. Muchos proveedores permiten elegir la región de almacenamiento en sus cuentas de empresa.
La región no lo resuelve todo. Importa también la nacionalidad del proveedor: la legislación de algunos países permite a sus autoridades exigir a una empresa propia los datos que custodia, estén donde estén almacenados. Es un criterio más para la evaluación del proveedor, junto a los de Cómo elegir una herramienta digital .
Un criterio antes de abrir los ajustes
Los ajustes deciden qué hace el proveedor con lo que recibe. Qué recibe lo decides tú, y ahí hay un criterio sencillo que vale para una persona y para una organización: clasificar la información por niveles y decidir a qué herramientas puede ir cada uno.
Público. Lo que ya está publicado o podría estarlo. Cualquier herramienta.
Interno. Lo que no es secreto pero no debería salir: procedimientos, planes, borradores. Solo herramientas contratadas por la organización.
Confidencial. Estrategia, cifras no publicadas, negociaciones en curso. Solo herramientas con contrato y controles, y lo mínimo imprescindible para la tarea.
Datos personales de terceros. Clientela, plantilla, candidaturas. Solo con base legal y contrato, o después de quitar lo que identifica a nadie.
Y un hábito que sirve en todos los niveles: la tarea casi nunca necesita el nombre. Para mejorar la redacción de una carta, el modelo no necesita saber a quién va; para revisar un análisis, rara vez necesita el nombre del cliente ni la cifra exacta. Quitar lo que identifica antes de pegar cuesta segundos, y la protección de datos europea lo llama minimización.
Qué comprobar en los ajustes
Una lista corta, que conviene repasar ahora y cada vez que llegue un correo del proveedor anunciando un cambio de condiciones:
- Qué cuenta estás usando. Personal o de la organización. Si tienes las dos, que el trabajo vaya por la segunda.
- Si el uso para entrenar está activado, y si venía así por defecto.
- Cuánto tiempo se guarda el historial y qué dice el proveedor que ocurre al borrar.
- Si existe un modo temporal o sin historial, y qué conserva igualmente.
- Si hay memoria entre conversaciones, qué ha guardado ya y cómo se borra.
- Qué conectores tiene activados —correo, calendario, almacenamiento— y a qué puede llegar con ellos.
- Si hay enlaces compartidos vivos que ya no deberían estarlo.
- Y para la organización: qué dice el contrato sobre entrenamiento, retención, región de almacenamiento y subencargados, y si hay acuerdo de tratamiento de datos firmado.
Las condiciones cambian, y cambian por escrito, en un aviso que casi nadie lee. Por eso la lista se repasa con fecha y se vuelve a repasar.
Lo que no está en ningún ajuste
Ningún ajuste decide qué se pega. Una herramienta bien configurada que recibe un contrato de un cliente con todos sus datos sigue siendo un contrato de un cliente fuera de casa.
Antes de pegar, la pregunta es a quién le estás dando esto, bajo qué contrato y para cuánto tiempo. Si no sabes responderla, la respuesta está en una pantalla de ajustes y en un contrato, y los dos se pueden leer.
Fuentes
- Reglamento (UE) 2016/679, Reglamento General de Protección de Datos — artículo 5 (minimización de datos), artículo 28 (encargado del tratamiento) y capítulo V (transferencias internacionales).
- Reglamento (UE) 2024/1689, Reglamento de Inteligencia Artificial .
- Nicholas Carlini et al., Extracting Training Data from Large Language Models , USENIX Security Symposium, 2021.
- Nicholas Carlini et al., Quantifying Memorization Across Neural Language Models , ICLR, 2023 — la repetición en los datos aumenta la memorización.