Saltar al contenido principal

Escaneo de seguridad

Los agentes fallan de formas en que el código común no falla. Un prompt puede ser secuestrado por texto que el agente lee. A una herramienta se la puede convencer de mandar un mail a un atacante. Una herramienta Python puede alcanzar una URL a la que nunca debió llegar.

Convolution Labs escanea tus agentes buscando estos problemas mientras los estás construyendo — no después de un incidente. Corré un escaneo desde Dashboard → Security, o desde la pestaña de seguridad de un agente.

Dos tipos de escaneo

Escaneo estático

Analiza el grafo del agente sin ejecutar nada: nodos, aristas, configuración, prompts y el código de cualquier herramienta Python propia. Es rápido, determinístico y gratis.

Hoy corren nueve checks:

CheckQué detecta
static.injection.unsanitized_inputEntrada de usuario que llega a un prompt sin sanitizar
static.injection.indirect_tool_feedbackSalida de herramienta realimentada a un prompt — la ruta de inyección indirecta
static.disclosure.secret_in_promptCredenciales o claves hardcodeadas en un prompt
static.ssrf.unfiltered_httpLlamadas HTTP con una URL influenciable por el atacante
static.agency.email_from_public_inputEnvío de email alcanzable desde entrada pública
static.output.unvalidated_sinkSalida del modelo que llega a un destino sin validación
static.sandbox.python_presentPresencia de Python propio — marca la superficie de ataque ampliada
static.dos.unbounded_iterationsBucles sin techo de iteraciones
static.dos.unbounded_delayNodos de espera sin límite

Escaneo dinámico

Ataca tu agente de verdad — por su ruta de ejecución normal, usando la misma cola y el mismo worker que una ejecución real. Cada sonda planta un canario generado por el servidor y un detector inspecciona la salida y la traza buscando evidencia de que el ataque funcionó.

SondaAtaque
dynamic.injection.canaryInyecta instrucciones y verifica si el agente las obedece
dynamic.disclosure.prompt_leakIntenta que el agente revele su prompt de sistema
dynamic.jailbreak.refusalPrueba si se pueden sortear las negativas de seguridad
dynamic.ssrf.canaryIntenta que el agente consulte una URL elegida por el atacante
nota

Los escaneos dinámicos ejecutan tu agente, así que consumen créditos por las llamadas a herramientas y usan tus claves LLM — igual que una ejecución normal. Solo apuntan a agentes que te pertenecen.

Hallazgos

Cada hallazgo trae:

  • Categoría — una de ocho, mapeada al OWASP LLM Top 10 y al NIST AI RMF
  • SeveridadCRITICAL, HIGH, MEDIUM, LOW o INFO
  • Evidencia — el nodo y el fragmento concretos que lo dispararon
  • Remediación — qué cambiar

Categorías

CategoríaSignificado
PROMPT_INJECTIONTexto no confiable dirigiendo el comportamiento del agente
SENSITIVE_INFO_DISCLOSURESecretos o prompts de sistema que se filtran
INSECURE_OUTPUT_HANDLINGSalida del modelo en la que confía un destino posterior
EXCESSIVE_AGENCYEl agente puede tomar acciones más allá de lo que debería
SSRFFalsificación de peticiones del lado del servidor
SUPPLY_CHAIN_SANDBOXRiesgo introducido por código y dependencias propias
UNBOUNDED_CONSUMPTIONBucles o esperas sin techo — costo y disponibilidad
JAILBREAKRestricciones de seguridad sorteadas

Triage

Cada hallazgo tiene un estado que controlás vos:

  • OPEN — cuenta en contra de tu puntaje
  • ACKNOWLEDGED — visto, aceptado por ahora
  • RESOLVED — corregido
  • FALSE_POSITIVE — no aplica a tu caso

Solo los hallazgos OPEN afectan el puntaje, así que triagear con honestidad lo sube.

El puntaje de seguridad

Un puntaje determinístico de 0 a 100, explicable en vez de una caja negra. Arranca en 100 y resta una penalización fija por cada hallazgo abierto:

SeveridadPenalización
CRITICAL−40
HIGH−20
MEDIUM−8
LOW−3
INFO0

El puntaje tiene piso en 0 y se traduce a una nota:

PuntajeNota
90–100A
75–89B
50–74C
25–49D
0–24F

Como el modelo es fijo, siempre podés explicar un puntaje — "−40 por un hallazgo crítico" — y ver exactamente cuánto recuperarías al corregir algo.

Referencia

Dashboard → Security → Reference documenta cada categoría: cuál es la debilidad, cómo se manifiesta específicamente en esta plataforma, un ejemplo ilustrativo de payload y qué checks la detectan. Tanto la vista OWASP LLM Top 10 como la de NIST se renderizan desde ese catálogo.

Límites

Los escaneos están limitados a 10 por hora por usuario.