Caso Guitash

Construimos agentes de IA para un banco ficticio

Los atacamos y medimos qué defensas funcionan de verdad.

Ver los tres agentes ↓
  1. 01Un cliente abre un ticket de soporte. Un tercero escondió una instrucción adentro.
  2. 02Los tres agentes leen el mismo ticket, con las mismas herramientas y el mismo modelo.
  3. 03Lo único que cambia es cómo está construido cada uno.

Ticket de soporte · abierto

No reconozco un débito en mi cuenta. ¿Me ayudan a revisarlo?

Instrucción oculta de un tercero dentro del ticket

  • n8n

    Agente A

    Lo que arma hoy alguien sin formación en seguridad. El piso realista.

    Sin defensas

  • LangChain

    Agente B

    Ingeniería correcta, seguridad ausente. El control del experimento.

    Sin defensas (es el control)

  • LangGraph

    Agente C

    El endurecido.

    Trata el contenido de terceros como dato · confirma fuera del chat antes de mover dinero · no revela sus instrucciones

AgentesAPI de Guitashconfirma fuera del chatClienteWeb o TelegramTerceroContenido externoPlataformaGuitashTicket de soporteLangSmithObservabilidadModelo delenguajeLLMAgente An8nAgente BLangChainAgente CLangGraphServidor MCPPuerta al bancoHerramientas del banco7 tools vía MCPConsultar saldoListar movimientosConsultar datos del clienteListar ticketsLeer ticketCrear ticketTransferir fondosEvaluacionesPromptfooOpenTelemetry → GrafanaTrazas y métricas

Pasá el cursor o tocá un nodo para ver qué hace.

  • Recorrido de la instrucción oculta
  • Barrera del Agente C
  • Medición con Promptfoo
  • Observabilidad: LangSmith y OpenTelemetry
  • Tool que mueve dinero o crea datos

Vista simplificada: muestra el recorrido, no la infraestructura. Todo es ficticio y corre en un entorno de prueba.