Connect with us
Shieldstral: clasificador multimodal de seguridad adaptable a políticas Shieldstral: clasificador multimodal de seguridad adaptable a políticas

Especificaciones

Shieldstral: clasificador multimodal de seguridad adaptable a políticas

Published

on

Shieldstral es un clasificador multimodal de 3B parámetros desarrollado por Mistral AI que evalúa la seguridad de contenido en texto e imágenes. A diferencia de otros modelos de moderación, permite definir políticas de seguridad en lenguaje natural durante la inferencia, sin requerir reentrenamiento. Está disponible bajo licencia Apache 2.0 y puede ejecutarse en una GPU NVIDIA de 16GB.

La moderación de contenido plantea preguntas como: ¿Este texto promueve violencia contra un grupo protegido? ¿Es segura esta imagen para menores? ¿El asistente rechazó una solicitud inapropiada? Las respuestas dependen del contexto, la audiencia y el uso previsto. Los modelos tradicionales de moderación suelen incorporar taxonomías fijas de categorías de daño, lo que limita su adaptabilidad a nuevos entornos sin reentrenamiento.

Funcionamiento de Shieldstral

Shieldstral aborda la moderación de contenido como una tarea de respuesta a preguntas binarias. Cada solicitud se estructura en tres componentes:

  • <Instruct> — contexto de evaluación, nivel de estrictez y, opcionalmente, definición de contenido no seguro.
  • <Query> — pregunta de sí/no, como “¿Este contenido promueve violencia física?”.
  • <Document> — contenido a evaluar: un prompt, una respuesta, un par prompt-respuesta o una imagen con texto opcional.

Durante la inferencia, el modelo calcula los logits de sí y no, aplicando una normalización softmax para generar una puntuación de seguridad continua. Este enfoque unifica la clasificación de prompts, moderación de respuestas, detección de rechazos y detección de toxicidad en un solo marco.

Características principales

Shieldstral presenta las siguientes características:

Advertisement
  • Rendimiento: según el reporte técnico de Mistral AI, el modelo iguala o supera a modelos abiertos de protección hasta 7 veces su tamaño en seguridad de texto, detección de rechazos, adaptabilidad de políticas y benchmarks multimodales. En el conjunto de datos Toxigen, alcanzó un F1-score de 0.92.
  • Adaptabilidad: las políticas se definen como consultas en lenguaje natural y se aplican en tiempo de inferencia, sin necesidad de reentrenamiento.
  • Eficiencia: modelo de 3B parámetros que opera en una GPU de 16GB para inferencia.
  • Puntuación continua: devuelve una probabilidad calibrada de sí/no en una sola pasada, permitiendo umbralizar o clasificar por confianza.
  • Accesibilidad: pesos disponibles bajo licencia Apache 2.0 en Hugging Face.

Comparación con otras herramientas

Shieldstral se diferencia de otras soluciones de moderación en los siguientes aspectos:

Característica Shieldstral OpenAI Moderation API Google Perspective API
Soporte multimodal (texto + imágenes) Sí No (solo texto) No (solo texto)
Políticas adaptables en tiempo real Sí No (taxonomía fija) No (taxonomía fija)
Pesos abiertos (Apache 2.0) Sí No (propietario) No (propietario)
Requisitos de hardware GPU de 16GB (inferencia) API en la nube API en la nube
Rendimiento en benchmarks F1-score: 0.92 (Toxigen) No público No público

Benchmarks

Shieldstral se evalúa en cuatro ejes principales, con muestras de evaluación excluidas del conjunto de entrenamiento:

  • Seguridad de texto: detección de contenido tóxico, violento o inapropiado en texto. F1-score: 0.92 (Toxigen).
  • Detección de rechazos: identificación de solicitudes dañinas o ilegales.
  • Adaptabilidad de políticas: capacidad para ajustarse a normas de seguridad definidas por el usuario.
  • Seguridad multimodal: evaluación de contenido combinado de texto e imágenes.

Gráfico comparativo de rendimiento de Shieldstral en seguridad de texto frente a otros modelos

Gráfico: Rendimiento de Shieldstral en seguridad de texto (Fuente: Mistral AI, 2026).

Desarrollo técnico

El desarrollo de Shieldstral se basó en cuatro enfoques clave para garantizar su efectividad:

Unificación de datos heterogéneos

Los conjuntos de datos públicos de seguridad presentan diferencias en taxonomías, etiquetas y convenciones de anotación. Shieldstral estandariza estos datos al formato instrucción-consulta-documento, variando la redacción para evitar sobreajuste a un solo estilo.

Enfoque en discriminación

En lugar de memorizar políticas predefinidas, Shieldstral se entrena con pares de políticas similares pero distintas. Un modelo de lenguaje reescribe texto seguro para crear ejemplos que violan una política pero no otra, lo que permite al modelo identificar qué política específica se incumple.

Advertisement

Seguridad en imágenes

Dado que los datos de seguridad visual son limitados, Shieldstral complementa los conjuntos de datos de moderación con imágenes de propósito general como ejemplos negativos. Cada par imagen-consulta se filtra mediante un reranker de lenguaje visual para reducir errores de etiquetado.

Combinación de modelos

Se utilizan técnicas como LoRA (Low-Rank Adaptation) para afinar el modelo con menos recursos, y SLERP (Spherical Linear Interpolation) para fusionar checkpoints entrenados de manera independiente. Esto permite combinar un modelo calibrado con datos públicos, otro con discriminación de políticas detalladas y el modelo base de instrucciones.

Shieldstral se desarrolló en Forge, la plataforma de Mistral AI para entrenar y evaluar modelos personalizados, que gestionó la infraestructura y el particionamiento de datos.

Próximos pasos

Mistral AI continúa trabajando en mejoras para Shieldstral, incluyendo:

  • Ampliación de la cobertura multilingüe.
  • Mejoras en la robustez para documentos largos.
  • Expansión de la seguridad multimodal a otros tipos de contenido.

Los pesos del modelo están disponibles para descarga en Hugging Face. Para más detalles técnicos, se puede consultar el reporte técnico.

Advertisement

Desarrolladores

DeepSeek V4.1 Flash corre en una sola RTX 3090 gracias a este proyecto

Published

on

DeepSeek V4.1 Flash corre en una sola RTX 3090 gracias a este proyecto

El proyecto open source dsv41-flash-offload logra servir DeepSeek V4.1 Flash, un modelo de unos 200GB en expertos, desde una única RTX 3090 de 24GB apoyada en RAM DDR4 y NVMe, con API compatible con OpenAI y contexto de 262,144 tokens.

(más…)

Continue Reading

Actualización

Un usuario logra que Windows 11 consuma solo 16 por ciento de RAM con 16GB

Published

on

Un usuario logra que Windows 11 consuma solo 16 por ciento de RAM con 16GB

El usuario @soyaakinohara6 compartió en X una instalación de Windows 11 que consume apenas 2.5GB de 16GB de RAM en reposo, un 16 por ciento de utilización. El método: instalar con Rufus, eliminar todo el bloatware y luego aplicar la actualización 26H2.

(más…)

Continue Reading

Curiosidades

ClawCall la IA que hace llamadas telefónicas por ti

Published

on

ClawCall la IA que hace llamadas telefónicas por ti

ClawCall es una inteligencia artificial que marca números de Estados Unidos, atraviesa los menús telefónicos, espera en la fila de retención y conversa con quien atienda. Al final reporta el resultado y la transcripción capturada. Funciona desde ChatGPT, Claude, iMessage y una API REST, con las primeras 30 llamadas gratis.

(más…)

Continue Reading

Lo más reciente

Lo más popular

Subscribete a nuestro Podcast

Trending