Destilación de IA: cómo roban el conocimiento de los modelos

Para fabricar licor de grano, se calienta una mezcla fermentada en un alambique hasta que los vapores ricos en alcohol ascienden y luego se enfrían para convertirlos en un líquido más fuerte. Los químicos y los productores de whisky conocen este proceso como destilación. Los desarrolladores de inteligencia artificial han tomado prestada la palabra para describir la reducción de un modelo grande de IA a uno más pequeño, y últimamente las mayores empresas de IA afirman que sus rivales han estado destilando como contrabandistas.
En septiembre, Anthropic y OpenAI detallaron cómo detectaron y detuvieron campañas para destilar sus modelos insignia, es decir, extraer suficiente información de los modelos para entrenar nuevos modelos que imiten a los originales con una fracción del tamaño y el costo. La destilación se ha convertido en un punto doloroso para las empresas estadounidenses de IA mientras intentan justificar altas valoraciones y defenderse de la competencia entre ellas y de las alternativas de código abierto. Si, por ejemplo, un desarrollador chino de modelos puede aprovecharse de todo el dinero y la potencia informática que esas empresas han invertido, el incentivo para seguir creando nuevos modelos empieza a desvanecerse.
Y nadie espera que la destilación se detenga pronto, así que preguntamos a los investigadores que la estudian para que expliquen la situación.
¿Qué es exactamente la destilación de IA?
Así como un alambique concentra un gran lote de líquido débil en uno más pequeño de sustancia fuerte, la destilación de IA condensa un modelo grande en uno más pequeño que, idealmente, actúa como el original. El proceso comienza con el modelo grande existente, llamado maestro. Los desarrolladores consultan al maestro muchas veces y luego alimentan sus respuestas al nuevo modelo, llamado estudiante, para entrenar a este último. En cierto modo, cada respuesta contiene información sobre lo que el maestro aprendió durante su entrenamiento, de modo que ese conocimiento pasa al estudiante sin pasar por el proceso de recopilar datos, encontrar patrones en ellos y obtener retroalimentación humana.
La destilación permite a alguien hacer ingeniería inversa de un modelo de IA simplemente usándolo y observando sus respuestas. Ayuda que los modelos de IA tiendan a revelar más que solo sus respuestas finales. “A menudo, el modelo maestro no solo te da la etiqueta, sino que en realidad te da información más detallada”, dice Yevgeniy Vorobeychik, profesor de ciencias de la computación en la Universidad de Washington en San Luis. Eso podría incluir las probabilidades que un modelo asigna a cada respuesta posible o, como en el caso que describió OpenAI, un registro cifrado del razonamiento paso a paso que sus modelos más potentes elaboran antes de responder.
Gran parte de la destilación es legítima. Los modelos más pequeños permiten a los desarrolladores obtener más por menos. De hecho, el concepto es anterior a los grandes modelos de lenguaje (LLM); en la década de 2000, los investigadores ya lo estudiaban como una forma de aumentar la eficiencia de las redes neuronales. “Nos preocupaba hacerlo más pequeño, más fácil de usar, más rápido de aplicar”, dice Alexandru Niculescu-Mizil, investigador de aprendizaje automático en Qube Research & Technologies, quien coescribió un artículo temprano sobre la idea en 2006.
Destilar el modelo de otro es otro cantar. El término captó la atención generalizada a principios de 2025, cuando DeepSeek, entonces una startup china poco conocida, lanzó un modelo de razonamiento llamado R1, que según dijo había entrenado por menos de 300,000 dólares, una fracción de lo que habían gastado los laboratorios estadounidenses. Pronto surgieron acusaciones de que DeepSeek había entrenado R1 en parte con respuestas extraídas de los modelos de OpenAI. Hoy en día, la palabra se asocia generalmente con acusaciones de robo de modelos, dirigidas principalmente a desarrolladores chinos como DeepSeek y Moonshot AI, el creador de Kimi.
En sus informes de septiembre, tanto Anthropic como OpenAI culparon a laboratorios con sede en China por las recientes campañas de destilación que detectaron, calificando la actividad de “ilícita” y “no autorizada”. DeepSeek y Moonshot AI han rechazado estas acusaciones en el pasado. Por supuesto, Anthropic y OpenAI también han sido acusadas de entrenar sus modelos con datos obtenidos sin autorización de todo internet. Aun así, aunque las empresas también presentan la destilación como un riesgo de seguridad, su interés más obvio en detenerla es proteger su ventaja competitiva.
“El texto que produce en respuesta a tu indicación está siendo robado por algunas empresas rivales”, dice Alexander Panfilov, estudiante de doctorado en el Instituto Max Planck de Sistemas Inteligentes en Alemania. “Pero a nivel conceptual, lo que estás robando son capacidades”.
¿Cómo se lleva a cabo la destilación?
En general, la destilación se realiza recopilando miles y miles de respuestas de IA a diferentes tipos de consultas. Esas indicaciones y respuestas se convierten en datos de entrenamiento para el estudiante, generalmente mediante un proceso llamado ajuste fino supervisado, que trata las respuestas del maestro como objetivos que el estudiante debe intentar emular. A lo largo de muchas rondas, el entrenamiento ajusta la configuración interna del estudiante, llamada pesos, para que sus respuestas se acerquen más a las del maestro.
La clave está en obtener esos datos. Anthropic y OpenAI han detallado varios métodos creativos que creen que los atacantes utilizaron para hacerlo. Según Anthropic, algunos laboratorios dirigían las consultas de sus propios clientes a Claude y luego guardaban las respuestas de Claude para entrenar sus propios modelos. La compañía también dijo que los destiladores intentan ocultar su ubicación. OpenAI, por su parte, afirmó que los destiladores intentaron acceder al razonamiento oculto de sus modelos “copiando el razonamiento cifrado de una conversación y pidiendo a un modelo en otra conversación que lo descifrara”. Panfilov fue coautor principal de un artículo preliminar que detalla ese tipo de ataque, y OpenAI le atribuyó a él y a sus colegas haber llamado la atención de la compañía sobre los ataques. En este caso, el objetivo era destilar cómo razonan los modelos, o generar respuestas más largas para resolver problemas difíciles paso a paso. Panfilov y sus colegas llamaron a su proyecto “Pensamientos Robados”, una señal de lo estrechamente que el concepto se ha entrelazado con el robo.
Las empresas de IA se muestran reacias a revelar exactamente cómo detectaron estos últimos intentos porque hacerlo mostraría al próximo destilador qué evitar. Sin embargo, en términos generales, las firmas parecen haber vigilado cuentas que consultaban sus modelos de maneras sospechosas, ya sea disparando muchas consultas en poco tiempo o haciendo preguntas reveladoras. Anthropic, por ejemplo, dijo que de mayo a julio observó más de 151 millones de intercambios entre Claude y cuentas vinculadas al gigante chino de comercio electrónico Alibaba, que también fabrica la familia de modelos de IA Qwen.
Panfilov dice que el ataque que estudió es fácil de detectar, pero le preocupa que los más astutos no puedan detectarse sin pisotear la privacidad de todos. “No tengo una buena idea de cómo lo harían [las empresas de IA], especialmente dado que afirman tener esta política de retención cero de datos”, dice, refiriéndose a los acuerdos según los cuales las empresas no almacenan algunas consultas y respuestas de los clientes.
El desafío de detener la destilación
Tanto OpenAI como Anthropic han advertido que los métodos de los destiladores solo se volverán más sofisticados, dado lo valiosa que puede ser la destilación. El problema es que las mismas cualidades que hacen que los modelos de IA sean informativos y útiles también los hacen buenos para entrenar. Por lo tanto, los intentos de hacer que un modelo sea más difícil de destilar también pueden empeorarlo.
Durante el verano, Vorobeychik y sus colegas descubrieron que el razonamiento de un modelo puede reescribirse para que sea un material de entrenamiento pobre para un imitador, sin hacer que las respuestas del modelo sean menos precisas. Sin embargo, también encontraron que el razonamiento reescrito era más difícil de seguir para las personas. “Solo por el hecho de que son más difíciles de leer para que el LLM los entrene, también son más difíciles de digerir para los humanos”, dice Vorobeychik. Es un intercambio poco deseable para una tecnología cuya producción ya recibe críticas por ser difícil de interpretar.
Panfilov también señala que la destilación se puede hacer en pedazos en los que “cada consulta en sí misma es benigna”. Eso dificultaría aún más distinguir a alguien que consulta un modelo para uso ordinario de alguien que intenta construir su propio modelo.
Las empresas de IA tendrán que equilibrar la protección de las capacidades de sus modelos con el hecho de exhibirlas para el público, que es, después de todo, lo que venden. Todo esto sugiere que detener la destilación ilícita significará encontrar nuevos ataques antes de erradicarlos. Los laboratorios, en efecto, están desempeñando el papel de recaudadores de impuestos, los agentes fiscales del licor que alguna vez cazaron y desmantelaron alambiques ilegales. Pero a medida que los temores sobre la destilación se entrelazan con los temores sobre las capacidades de la IA china en general, desmantelar alambiques uno por uno puede no ser suficiente para tranquilizar a la industria estadounidense de IA.






