Inicio / Inteligencia artificial / ChatGPT / OpenAI quiere detectar abusos de sus modelos sin que sus empleados puedan leer las conversaciones empresariales

OpenAI quiere detectar abusos de sus modelos sin que sus empleados puedan leer las conversaciones empresariales

laptop office
  • Private Safety Processing analiza automáticamente patrones distribuidos entre varias interacciones y devuelve señales limitadas de riesgo sin entregar a OpenAI el contenido que las originó.
  • La arquitectura pretende mantener Zero Data Retention y tendrá una modalidad con almacenamiento cifrado mediante claves que permanecen bajo control del propio cliente.

OpenAI prepara una nueva arquitectura de seguridad destinada a resolver una tensión cada vez más importante para empresas que utilizan modelos avanzados: cómo detectar comportamientos potencialmente peligrosos que aparecen durante varias interacciones sin obligar al proveedor de inteligencia artificial a conservar y leer conversaciones sensibles. La compañía denomina al sistema Private Safety Processing y actualmente lo prueba con un grupo inicial de clientes.

La propuesta parte de Zero Data Retention, la modalidad disponible para determinados clientes de la API mediante la que OpenAI no conserva los mensajes ni las respuestas después de procesar una solicitud. El contenido de esos clientes tampoco está disponible de forma ordinaria para revisión por parte del personal de OpenAI y sus datos empresariales no se utilizan para entrenar modelos salvo que exista una autorización expresa.

¿Quieres seguir toda la actualidad tecnológica? Añade Complubits como fuente preferida en Google para encontrar nuestras noticias más fácilmente. Añadir como fuente preferida

Ese planteamiento crea una dificultad cuando un posible abuso solo resulta evidente después de observar varias acciones relacionadas. Los sistemas compatibles actualmente con ZDR pueden analizar cada interacción individual, pero una secuencia aparentemente inocua puede adquirir otro significado cuando varias solicitudes forman parte de un mismo proceso. Private Safety Processing pretende extender la detección automatizada a esas secuencias sin proporcionar al personal acceso directo al contenido.

En los despliegues ZDR, los datos continuarán permaneciendo en infraestructura controlada por el cliente. OpenAI desarrolla también otra modalidad en la que el contenido puede alojarse en sus sistemas pero queda cifrado mediante claves controladas por la propia organización. La compañía asegura que su personal no dispondrá de una copia de esas claves y, por tanto, no podrá descifrar las conversaciones almacenadas bajo ese esquema.

Cuando los sistemas automáticos detecten un posible riesgo, OpenAI recibiría únicamente una señal limitada que describa la categoría de actividad identificada. Esa señal podría utilizarse para determinar si corresponde aplicar una medida de seguridad, pero no incluiría las conversaciones originales. El cliente conservaría la capacidad de investigar el incidente mediante sus propios registros y decidir qué información comparte posteriormente si quiere recurrir una decisión o documentar un abuso.

El sistema no debe confundirse con una nueva configuración de privacidad disponible para cualquier usuario de ChatGPT. OpenAI lo presenta específicamente dentro de su oferta para clientes empresariales y de API con necesidades estrictas de retención y seguridad. La compañía continúa además sometida a obligaciones legales concretas; por ejemplo, mantiene una excepción para determinadas imágenes potencialmente relacionadas con material de abuso sexual infantil que requieran revisión y denuncia.

Private Safety Processing continúa en fase de pruebas y OpenAI todavía no ha publicado todos sus detalles técnicos. La compañía prevé comenzar el despliegue durante septiembre y acompañarlo de un documento técnico, que será el siguiente momento importante para conocer exactamente qué información contienen las señales de riesgo, cómo se aíslan los datos y qué garantías técnicas respaldan el modelo de cifrado anunciado.

Deje un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *