El flujo de trabajo de clasificación de SOC de SoftBank Corp. está automatizado con el modelo de código abierto de Cisco Foundation AI.

Introducción

SoftBank Corporation («SoftBank») ha integrado el modelo Foundation-sec-1.1-8B-Instruct de Cisco Foundation AI en los flujos de trabajo de inspección de su Centro de operaciones de seguridad (SOC) para automatizar completamente la detección de software sospechoso, la validación dinámica de políticas y las operaciones relacionadas. La plantilla Foundation-sec-1.1-8B-Instruct clasifica los nombres de software en 17 categorías diferentes para la aplicación de políticas y es fundamental para una automatización eficaz del flujo de trabajo de un extremo a otro.

En este blog, explicaremos cómo el modelo Foundation-sec-1.1-8B-Instruct encaja en el proceso de clasificación de SoftBank y cómo puede ser muy preciso en la clasificación de software.

Flujo de trabajo de clasificación automatizado

Figura 1: Flujo de trabajo de detección de archivos sospechosos en SoftBank.


La detección de software sospechoso es un caso de uso común en las operaciones de seguridad. En SoftBank, las categorías de software se definen en función de las capacidades y los riesgos de seguridad. Una vez determinada la clasificación, el software aplica las políticas relevantes de la empresa y toma las acciones adecuadas según la red detectada.

Anteriormente, los analistas realizaban manualmente la clasificación de archivos, la validación de políticas y la respuesta, un proceso que requería mucho tiempo y mano de obra. Para permitir que los analistas se centren en investigaciones más importantes, SoftBank decidió automatizar los flujos de trabajo utilizando marcos de automatización y modelos de lenguaje grandes (LLM).

El marco de automatización agiliza las verificaciones y respuestas de políticas. Sin embargo, automatizar la clasificación de software ha sido un desafío debido a la gran cantidad de software disponible, funciones superpuestas y reglas de clasificación específicas de la organización. Como resultado, la clasificación se convirtió en la pieza final necesaria para ayudar automáticamente a los analistas humanos.

Modelo básico de IA para clasificación.

Para resolver el desafío de la clasificación, SoftBank eligió LLM por su conocimiento general del software y su capacidad para seguir instrucciones. Un LLM basado en la nube no era una opción debido a los requisitos de privacidad de datos. Foundation-sec-1.1-8B-Instruct se destaca como una plantilla de código abierto que se puede utilizar sobre el terreno. Su tamaño compacto reduce los costos operativos y su capacitación previa en seguridad dedicada le permite superar a modelos similares de código abierto de propósito general para tareas de seguridad.

Para la clasificación, el modelo acepta nombres de software como entrada y selecciona una de las 17 categorías de salida. El principal problema radica en las definiciones de clases duplicadas y en el software con muchas funciones. Además, la salida del modelo debe tener un formato estricto con nombres de categorías sólo para facilitar el flujo de trabajo.

Optimización de salida

Para abordar estos desafíos, el equipo de IA de la Fundación Cisco trabajó en estrecha colaboración con SoftBank en un ajuste rápido para garantizar una salida del modelo estable y precisa.


Optimización 1: formato de salida

Primero, se adjuntan algunos ejemplos al final de la línea para guiarlo a la hora de colocar la plantilla en el formato de salida correcto. La última parte del mensaje tiene el formato siguiente.

# Ejemplo
Entrada: SOFTWARE_1
Salida: CAT_001

Entrada: SOFTWARE_2
Salida: CAT_005

Entrada: SOFTWARE_3
Salida: CAT_011
# Ahora es tu turno:

Ingresar:
Producción:

Estos pocos ejemplos definen reglas de salida y, combinados con indicaciones del sistema que incluyen validación, el modelo produce consistentemente una categoría válida para cada entrada. También integramos la validación de resultados en el flujo de trabajo; Si el modelo no devuelve un nombre de categoría válido, el proceso de inferencia se repite hasta que se obtiene el resultado correcto. Esta combinación de ingeniería rápida y validación de resultados nos permite lograr resultados de clasificación estables y bien formateados.


Optimización 2: definición de clasificación

Luego introdujimos reglas de clasificación basadas en lógica de expertos y datos históricos para aclarar el alcance de cada categoría. Sin embargo, naturalmente se produce cierta superposición entre las categorías.

Por ejemplo, «Transferencia de archivos», «Compartir archivos» y «Servicios de Internet prohibidos» se rigen por reglas diferentes. El software de almacenamiento en la nube como OneDrive debería clasificarse como un «Servicio de Internet prohibido», pero este modelo lo clasifica erróneamente como «Compartir archivos» debido a su funcionalidad para compartir. Existe una confusión similar entre los pares «Captura de paquetes y análisis de vulnerabilidades» y «Servicios de servidor y transferencia de archivos». Para mejorar el rendimiento del modelo, identificamos estas clasificaciones erróneas comunes y agregamos pautas descriptivas para ayudar al modelo a distinguirlas.

Por ejemplo, agregamos la siguiente lógica de razonamiento a las categorías «Creación de paquete» y «Análisis de vulnerabilidad».
Validación de casos ambiguos (evaluar secuencialmente):

1. ¿Genera informes de vulnerabilidad o información CVE? → Sí: Análisis de vulnerabilidades / No: Pasar a la siguiente sección.

2. ¿El objetivo principal es interceptar, grabar o generar imágenes de paquetes? → Sí: Capturar paquete / No: Pasar a la siguiente sección.

3. ¿El objetivo principal es el control de la red o el control del ancho de banda? → Sí: Capturar paquete / No: Pasar a la siguiente sección.

4. ¿El objetivo principal es detectar o diagnosticar la vulnerabilidad de un grupo objetivo? → Sí: Análisis de vulnerabilidades / No: CAT_001.

A lo largo de este proceso, hemos mantenido la información breve para evitar confusiones y garantizar una categorización confiable.


Optimización 3: preprocesamiento y posprocesamiento

La categoría 17, «Sin especificar», está destinada a capturar software que no encaja en las otras 16 categorías. Durante las pruebas, observamos que el modelo asignaba con fuerza una categoría al software que debería haberse marcado como «Indefinido». En producción, estas clasificaciones erróneas pueden dar lugar a falsos positivos porque la categoría «Indefinido» no genera ninguna regla específica.

El ajuste rápido ha reducido la mayoría de estos casos, pero persisten algunos casos específicos de empresas en los que archivos potencialmente vulnerables se marcan incorrectamente como benignos. Para mitigar esto, agregamos la lista blanca como un paso de preprocesamiento y un posprocesamiento adicional para filtrar los falsos positivos.


Resultados de la clasificación

Los experimentos se realizaron en un conjunto de datos que constaba de detección histórica y categorías anotadas por humanos. Para evitar el sobreajuste, ampliamos el conjunto de datos con nombres de firmware comunes y etiquetas de verdad verificadas manualmente.

Utilizando estas 17 clases, el modelo Foundation-sec-1.1-8B-Instruct logró una precisión del 80,75 %, lo que es comparable a la misma tarea de LLM basada en la nube. Combinado con nuestro sistema basado en reglas y nuevos pasos previos y posteriores al procesamiento, la precisión general del flujo de trabajo ha alcanzado el 90 %, lo que hace que las operaciones diarias sean altamente eficientes.

Conclusión

La adopción por parte de SoftBank del modelo de IA de Cisco Foundation demuestra que LLM puede realizar tareas de clasificación de manera efectiva sin un reentrenamiento y ajuste que requiere muchos recursos, lo que se usa comúnmente para resúmenes y análisis. Este enfoque muestra que al definir con precisión qué tareas de flujo de trabajo requieren verdadera IA, las organizaciones pueden lograr sus objetivos de automatización al mismo tiempo que reducen las demandas computacionales y mejoran la confiabilidad en comparación con depender completamente de flujos de trabajo basados ​​en LLM.

En el futuro, SoftBank planea utilizar este método no sólo para detectar archivos sospechosos, sino también para automatizar la respuesta de los sistemas de detección de intrusos (IDS). Dado que la automatización de IDS se ocupa de redes confidenciales e información relacionada con la seguridad, las características de seguridad y privacidad de datos del modelo Foundation AI lo hacen más adecuado para futuros flujos de trabajo de operaciones de seguridad.

Testimonios de usuarios

«A través de nuestro PoV conjunto con Cisco, hemos confirmado que el modelo de IA de Cisco Foundation puede ayudar a optimizar la clasificación del software, un paso crítico en nuestro flujo de trabajo de inspección de SOC. Su modelo in situ cumple con nuestros requisitos de privacidad de datos, y PoV ha demostrado precisión práctica, incluyendo más del 85% de precisión en el nivel de flujo de trabajo esperado. Este enfoque ayudará a nuestros analistas a reducir los esfuerzos de clasificación manual y centrarse más en la investigación de seguridad».

Hajime Uematsu, Director de Garantía de Seguridad, SoftBank Corp.

Carmela Aranda

Acerca de Carmela Aranda

Carmela Aranda sociedad anónima cerrada es una asociación sin fines de lucro que ayuda y maneja el tema de los libros y cierres de mes que sepan como suplir en las empresas.

Ver todas las entradas de Carmela Aranda →

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *