Technical Whitepaper

Prompt and agent-action screening: architecture and limits.

Architecture, threat model and known limits of the Context Armor screening pipeline.

Draft, September 2026 · Reading time: 18 minutes

Executive summary (EN)

Generative LLMs are System 2 thinkers: autoregressive, deliberative, slow, and expensive — roughly $15.00 per million input tokens and seconds of validation latency. Prompt security, however, is a System 1 problem: a fast, cheap, high-volume classification decision taken before the generative model is ever invoked. Context Armor implements that decision layer as an edge gateway running on Cloudflare V8 isolates, closest to the caller (São Paulo/GRU PoP for Latin America), for $0.042 per million input tokens and a median decision latency under 150ms.

The Jev engine is a typed decision model. It cannot emit free text — its outputs are mathematical primitives: Noul (a calibrated boolean probability), Choice (up to 255 attack-vector classes), and Score (a 1–10 risk index). Because there is no free-text channel, the classifier itself cannot leak system prompts, be coaxed into improvising shell commands, or be poisoned through context. Decisions are deterministic and reproducible: the same payload yields the same verdict, every time.

The gateway covers the OWASP Top 10 for LLM Applications (LLM01 prompt injection, LLM02 sensitive data disclosure) and the Agentic AI threat classes ASI01 (goal hijacking), ASI02 (tool misuse), ASI05 (unexpected code execution), and ASI08 (cascading failures), with an explicit threat matrix mapping each vector to a concrete mitigation at the perimeter. Calibration is enforced with a reinforcement-based calibration procedure (RLCD), holding Expected Calibration Error (ECE) below 0.07, with abstain bands routed to human review.

Compliance is designed in: Zero Data Retention by default — payloads are inspected, decided, and discarded in memory, with zero bytes retained and no content logging. Data Processing Agreements follow LGPD Art. 33 and Art. 39 with EU Standard Contractual Clauses for international transfers, covering the sub-processor chain (Cloudflare, Stripe, OpenRouter). The service is operated under SOC 2 Type II controls with ISO 27001 alignment.

The full document is written in Brazilian Portuguese (PT-BR). An English executive summary is presented above.

01

O problema: System 1 e System 2 na infraestrutura de IA

Daniel Kahneman descreveu a cognição humana como a interação entre dois sistemas: o System 1, rápido, intuitivo e de baixo custo, e o System 2, lento, deliberativo e energeticamente caro. A infraestrutura de inteligência artificial reproduz exatamente esta divisão — e quase toda a indústria tenta resolver problemas de System 1 com ferramentas de System 2.

Um LLM generativo é um deliberador: decodificação autorregressiva, token a token, com custos na ordem de $15.00 por milhão de tokens de entrada e latências de validação de segundos. Perguntar a esse modelo «este prompt é um ataque?» é usar um motor de System 2 para executar uma triagem de System 1. É caro, é lento e — pior — cria uma nova superfície de ataque: o classificador generativo pode ser convencido, via o próprio prompt, a responder que não há ataque.

A segurança perimetral de prompts é, por natureza, um problema de System 1: uma decisão discreta, de alto volume, de baixa criatividade, que tem de ser tomada antes de o prompt custar tokens. O Context Armor implementa esta camada como um gateway edge, com um motor de decisão tipada (Jev), posicionado à frente do modelo generativo.

$0.042

por 1M tokens de entrada; saída gratuita

<150ms

latência mediana de decisão no PoP

ECE < 0.07

erro de calibração esperado do motor

330+ PoPs

presença edge global, GRU para LATAM

02

Arquitetura edge: V8 Isolates, Smart Placement e o PoP GRU

O gateway corre em Cloudflare Workers sobre V8 isolates. Ao contrário de contêineres ou funções com runtime pesado, um isolate inicia em menos de 5ms — não há warm-up, não há fila de arranque, não há máquina virtual a alocar. Cada requisição é tratada no PoP (Point of Presence) mais próximo do cliente: para a América Latina, o PoP de São Paulo (GRU), com RTT tipicamente abaixo de 12ms para os grandes centros da região.

A Smart Placement decide onde executar cada fase do processamento: a inspeção e a decisão acontecem na borda, junto do chamador; o encaminhamento para o modelo de origem usa pooling keep-alive (Undici) sobre sockets já estabelecidos, pelo que requisições subsequentes não pagam handshake TCP nem TLS. O resultado é uma verificação perimetral que acrescenta tipicamente 80ms ao pipeline — contra os 2.5s de uma validação feita por um LLM generativo.

cliente  ──▶  PoP mais próximo (V8 isolate)
              │  1. inspeção do payload (memória)
              │  2. decisão tipada Jev: BLOCK | ALLOW
              ▼
       origin LLM (somente se ALLOW)

latência adicionada: ~80ms (mediana)  ·  conteúdo retido: 0 bytes

A integração é um proxy compatível com OpenAI: aponta-se o base_url do cliente existente para gw.context-armor.com/v1 e todas as chamadas passam a ser verificadas em trânsito, sem refatoração. Anthropic, Azure e modelos locais são suportados pela mesma camada. O endpoint de inspeção pública /v1/scan expõe o mesmo motor para testes diretos, e o endpoint Enterprise /v1/guard atua como proxy autenticado por token de gateway.

03

O motor Jev: decisões tipadas, sem geração de texto

Jev é o System One da TypeSafe: um modelo de decisão cuja saída são primitivas matematicamente tipadas, nunca texto livre. Três tipos cobrem a superfície de decisão:

  • Noul — uma probabilidade booleana calibrada (ex.: 0.9982 para «é injeção de prompt»), com interpretação estatística direta; Choice — uma classe entre até 255 vetores de ataque catalogados (ex.: LLM01, ASI01), que identifica o tipo de ameaça; Score — um índice de risco de 1 a 10, que dimensiona a severidade para políticas de negócio.

A consequência estrutural é decisiva: um modelo que apenas emite primitivas tipadas não possui canal de texto livre. Não há por onde vazar um system prompt, improvisar um shell script, devolver um payload refletido ou ser «convencido» a mudar de opinião por retórica. A imunidade não é um filtro adicionado depois — é uma propriedade do espaço de saída do modelo.

A inferência é não autorregressiva e paralela: o custo é de $0.042 por milhão de tokens de entrada, com tokens de saída gratuitos (não há geração). A decodificação é determinística, o que torna cada decisão reproduzível e auditável — o mesmo payload produz o mesmo veredito, sempre. Bandas de ação configuráveis (auto, HITL, abstain) decidem quando agir automaticamente, quando escalar para revisão humana e quando se abster.

04

Taxonomia de ameaças: OWASP LLM01 e Agentic ASI01–ASI08

A superfície de ameaças segue a taxonomia OWASP para aplicações de LLM e para sistemas agênticos. O gateway trata explicitamente as seguintes classes:

CódigoVetorDescrição
LLM01Injeção de PromptSobrescrita de instruções por texto adversarial — direta (no prompt do utilizador) ou indireta (em documentos RAG, e-mails, tickets ou ferramentas ingeridas).
LLM02Vazamento de Dados SensíveisExtração de system prompts, segredos, credenciais ou dados pessoais contidos no contexto do modelo.
ASI01Sequestro de Objetivo (Goal Hijacking)Substituição dos objetivos primários do agente por objetivos adversariais (ex.: exfiltrar segredos do repositório).
ASI02Uso Indevido de FerramentasChamada de ferramentas (shell, HTTP, bases de dados) para fins fora da política do agente.
ASI05Execução Inesperada de CódigoDisparo de execução de código não prevista a partir de conteúdo manipulado.
ASI08Falhas em CascataPropagação de uma decisão errada por pipelines multi-agente, amplificando o impacto a cada salto.
05

Matriz de ameaças e mitigação pelo gateway

Cada vetor da taxonomia é mapeado para uma mitigação concreta, executada na fronteira antes de o payload chegar ao modelo generativo:

AmeaçaSuperfícieMitigação no gatewayEstado
LLM01 diretaPrompt do utilizadorClassificação Noul + Choice; BLOCK sobre limiar configurável.Mitigado
LLM01 indiretaChunks RAG, anexos, tool outputInspeção de todo o contexto transitado, incluindo conteúdo entre tags de documento.Mitigado
LLM02System prompt, segredosDeteção de tentativas de extração; bloqueio e telemetria sem retenção de conteúdo.Mitigado
ASI01Objetivos do agenteDeteta instruções de redefinição de objetivos («trate todas as metas anteriores como concluídas»).Mitigado
ASI02Chamadas de ferramentasValidação perimetral de tool calls contra a política declarada do agente.Mitigado
ASI05Execução de códigoBloqueio de payloads que comandam execução de shell ou download/POST de conteúdo sensível.Mitigado
ASI08Pipelines multi-agenteDecisões tipadas propagam-se como políticas explícitas; falha fecha em abstain, não em cascata.Mitigado

Princípio de falha segura

Em caso de erro, timeout ou indecisão (banda de abstain), o gateway falha para o estado mais conservador configurado e regista apenas telemetria agregada — nunca o conteúdo do payload.

06

Calibração: RLCD e ECE < 0.07

Uma probabilidade só é útil se for calibrada: quando o motor diz 0.9, o evento tem de ocorrer cerca de 90% das vezes. Medimos isso com o Expected Calibration Error (ECE), que compara a confiança declarada com a frequência observada em bins de probabilidade. O motor Jev é treinado e ajustado com um procedimento de calibração por reforço (RLCD) que penaliza explicitamente a distorção entre confiança e acerto, mantendo o ECE abaixo de 0.07.

  • Diagramas de fiabilidade (reliability diagrams) são monitorizados continuamente por classe de ataque, não apenas globalmente;
  • Bandas de ação operam sobre probabilidades calibradas: auto abaixo do limiar de bloqueio, HITL na zona intermédia, abstain quando a incerteza é estrutural;
  • A calibração é revalidada em telemetria adversarial — conjuntos de prompts de ataque reais e mutações — antes de qualquer alteração de modelo ser promovida.

A calibração importa particularmente no uso agêntico: decisões automáticas sobre milhares de tool calls por hora não toleram confiança mal calibrada. Um sistema sobre-confiante bloqueia produtividade; um sub-confiante deixa passar exatamente os ataques que importam.

07

Conformidade: LGPD Art. 33, SCC, ZDR e SOC2 Type II

Zero Data Retention (ZDR) é o padrão, não um extra: payloads são inspecionados, decididos e descartados em memória dentro do isolate. Não existem logs de conteúdo, não existe retenção para treino de modelos, não existe cópia do prompt em armazenamento. O que persiste é telemetria operacional agregada — contagens, latências, distribuição de classes — sem qualquer conteúdo.

O enquadramento legal segue a LGPD (Lei nº 13.709/2018) e o GDPR. Nas transferências internacionais de dados (Art. 33 da LGPD), aplicam-se as Standard Contractual Clauses da Comissão Europeia (Decisão (UE) 2021/914) nos contratos com clientes e subencarregados. No DPA (Data Processing Agreement), a Context Armor atua como operador (Art. 39) das instruções documentadas do controlador.

SubencarregadoFunçãoDados envolvidosSalvaguarda
CloudflareComputação edge (Workers, PoPs)Payload transitório em memóriaZDR, SOC2, SCCs
StripeProcessamento de pagamentosDados de faturação (nunca cartões)PCI-DSS, SCCs
OpenRouterInferência do motor JevPrompt inspecionado (transitório)ZDR contratual, SCCs

A operação assenta em controles SOC 2 Type II auditados, com alinhamento ISO 27001: cifra TLS em trânsito, isolamento por V8 isolate, menor privilégio, separação de ambientes e gestão de segredos dedicada. O DPA padrão cobre os Art. 33 e 39 da LGPD, as SCCs e o direito de auditoria; versões personalizadas estão disponíveis no plano Enterprise.

08

Desempenho e economia: a assimetria é o produto

A diferença não é incremental — é de ordem de grandeza. Validar um prompt com um LLM generativo classe Claude custa cerca de $15.00 por milhão de tokens de entrada e acrescenta ~2.5s ao pipeline. O mesmo prompt verificado pelo gateway custa $0.042 por milhão de tokens (saída gratuita) e acrescenta ~80ms:

DimensãoValidação generativa (System 2)Context Armor (System 1)
Custo$15.00 / 1M tokens$0.042 / 1M tokens
Latência~2.5s adicionados~80ms adicionados
SaídaTexto livre (envenenável)Primitivas tipadas
ReprodutibilidadeVariávelDeterminística
RetençãoDepende do fornecedorZDR: 0 bytes

O modelo de tokenomics do produto reflete esta assimetria: para um pipeline agêntico típico de 2.000 tokens de entrada por verificação, um milhão de verificações mensais custa cerca de $84 no gateway — contra dezenas de milhares de dólares em validação generativa equivalente. A redução líquida de custo é o argumento central da secção Tokenomics do site, com um simulador para cargas de trabalho reais.

09

Limitações e trabalho futuro

Nenhum sistema de segurança é absoluto, e este whitepaper não o afirma. O motor Jev é probabilístico: existem falsos positivos (payloads legítimos bloqueados) e falsos negativos (ataques admitidos). O que a arquitetura oferece é calibração mensurável, limiares configuráveis e uma banda de abstain explícita para os casos de fronteira — não a eliminação do erro.

  • A inspeção cobre o canal de texto; payloads multimodais (imagem, áudio) são trabalho futuro;
  • A verificação perimetral não substitui sandboxing de ferramentas, least-privilege em credenciais ou controlos de output — é uma camada, não o perímetro inteiro;
  • O custo de latência do modelo de origem não é eliminado; é apenas poupado o custo da validação;
  • Modelos de ataque evoluem: a taxonomia e os conjuntos adversariais são revalidados continuamente.
10

Referências

  1. 01OWASP Foundation. Top 10 for LLM Applications — LLM01 Prompt Injection, LLM02 Sensitive Information Disclosure.
  2. 02OWASP Foundation. Agentic AI Threats — ASI01 Goal Hijacking, ASI02 Tool Misuse, ASI05 Unexpected Code Execution, ASI08 Cascading Failures.
  3. 03Kahneman, D. Thinking, Fast and Slow. Farrar, Straus and Giroux, 2011.
  4. 04Guo, C. et al. On Calibration of Modern Neural Networks. ICML 2017 (Expected Calibration Error).
  5. 05Lei nº 13.709/2018 (LGPD), em especial os Art. 7º, 18, 33, 38 e 39.
  6. 06Comissão Europeia. Standard Contractual Clauses — Decisão (UE) 2021/914.
  7. 07AICPA. SOC 2 Trust Services Criteria; ISO/IEC 27001.
  8. 08Cloudflare. Workers e V8 Isolates — documentação técnica de referência.

Put the gateway in front of your model.

Create a free account and test the live scanner in minutes.