Technical Whitepaper
Prompt and agent-action screening: architecture and limits.
Architecture, threat model and known limits of the Context Armor screening pipeline.
Draft, September 2026 · Reading time: 18 minutes
Executive summary (EN)
Generative LLMs are System 2 thinkers: autoregressive, deliberative, slow, and expensive — roughly $15.00 per million input tokens and seconds of validation latency. Prompt security, however, is a System 1 problem: a fast, cheap, high-volume classification decision taken before the generative model is ever invoked. Context Armor implements that decision layer as an edge gateway running on Cloudflare V8 isolates, closest to the caller (São Paulo/GRU PoP for Latin America), for $0.042 per million input tokens and a median decision latency under 150ms.
The Jev engine is a typed decision model. It cannot emit free text — its outputs are mathematical primitives: Noul (a calibrated boolean probability), Choice (up to 255 attack-vector classes), and Score (a 1–10 risk index). Because there is no free-text channel, the classifier itself cannot leak system prompts, be coaxed into improvising shell commands, or be poisoned through context. Decisions are deterministic and reproducible: the same payload yields the same verdict, every time.
The gateway covers the OWASP Top 10 for LLM Applications (LLM01 prompt injection, LLM02 sensitive data disclosure) and the Agentic AI threat classes ASI01 (goal hijacking), ASI02 (tool misuse), ASI05 (unexpected code execution), and ASI08 (cascading failures), with an explicit threat matrix mapping each vector to a concrete mitigation at the perimeter. Calibration is enforced with a reinforcement-based calibration procedure (RLCD), holding Expected Calibration Error (ECE) below 0.07, with abstain bands routed to human review.
Compliance is designed in: Zero Data Retention by default — payloads are inspected, decided, and discarded in memory, with zero bytes retained and no content logging. Data Processing Agreements follow LGPD Art. 33 and Art. 39 with EU Standard Contractual Clauses for international transfers, covering the sub-processor chain (Cloudflare, Stripe, OpenRouter). The service is operated under SOC 2 Type II controls with ISO 27001 alignment.
The full document is written in Brazilian Portuguese (PT-BR). An English executive summary is presented above.
O problema: System 1 e System 2 na infraestrutura de IA
Daniel Kahneman descreveu a cognição humana como a interação entre dois sistemas: o System 1, rápido, intuitivo e de baixo custo, e o System 2, lento, deliberativo e energeticamente caro. A infraestrutura de inteligência artificial reproduz exatamente esta divisão — e quase toda a indústria tenta resolver problemas de System 1 com ferramentas de System 2.
Um LLM generativo é um deliberador: decodificação autorregressiva, token a token, com custos na ordem de $15.00 por milhão de tokens de entrada e latências de validação de segundos. Perguntar a esse modelo «este prompt é um ataque?» é usar um motor de System 2 para executar uma triagem de System 1. É caro, é lento e — pior — cria uma nova superfície de ataque: o classificador generativo pode ser convencido, via o próprio prompt, a responder que não há ataque.
A segurança perimetral de prompts é, por natureza, um problema de System 1: uma decisão discreta, de alto volume, de baixa criatividade, que tem de ser tomada antes de o prompt custar tokens. O Context Armor implementa esta camada como um gateway edge, com um motor de decisão tipada (Jev), posicionado à frente do modelo generativo.
$0.042
por 1M tokens de entrada; saída gratuita
<150ms
latência mediana de decisão no PoP
ECE < 0.07
erro de calibração esperado do motor
330+ PoPs
presença edge global, GRU para LATAM
Arquitetura edge: V8 Isolates, Smart Placement e o PoP GRU
O gateway corre em Cloudflare Workers sobre V8 isolates. Ao contrário de contêineres ou funções com runtime pesado, um isolate inicia em menos de 5ms — não há warm-up, não há fila de arranque, não há máquina virtual a alocar. Cada requisição é tratada no PoP (Point of Presence) mais próximo do cliente: para a América Latina, o PoP de São Paulo (GRU), com RTT tipicamente abaixo de 12ms para os grandes centros da região.
A Smart Placement decide onde executar cada fase do processamento: a inspeção e a decisão acontecem na borda, junto do chamador; o encaminhamento para o modelo de origem usa pooling keep-alive (Undici) sobre sockets já estabelecidos, pelo que requisições subsequentes não pagam handshake TCP nem TLS. O resultado é uma verificação perimetral que acrescenta tipicamente 80ms ao pipeline — contra os 2.5s de uma validação feita por um LLM generativo.
cliente ──▶ PoP mais próximo (V8 isolate)
│ 1. inspeção do payload (memória)
│ 2. decisão tipada Jev: BLOCK | ALLOW
▼
origin LLM (somente se ALLOW)
latência adicionada: ~80ms (mediana) · conteúdo retido: 0 bytesA integração é um proxy compatível com OpenAI: aponta-se o base_url do cliente existente para gw.context-armor.com/v1 e todas as chamadas passam a ser verificadas em trânsito, sem refatoração. Anthropic, Azure e modelos locais são suportados pela mesma camada. O endpoint de inspeção pública /v1/scan expõe o mesmo motor para testes diretos, e o endpoint Enterprise /v1/guard atua como proxy autenticado por token de gateway.
O motor Jev: decisões tipadas, sem geração de texto
Jev é o System One da TypeSafe: um modelo de decisão cuja saída são primitivas matematicamente tipadas, nunca texto livre. Três tipos cobrem a superfície de decisão:
- Noul — uma probabilidade booleana calibrada (ex.: 0.9982 para «é injeção de prompt»), com interpretação estatística direta; Choice — uma classe entre até 255 vetores de ataque catalogados (ex.: LLM01, ASI01), que identifica o tipo de ameaça; Score — um índice de risco de 1 a 10, que dimensiona a severidade para políticas de negócio.
A consequência estrutural é decisiva: um modelo que apenas emite primitivas tipadas não possui canal de texto livre. Não há por onde vazar um system prompt, improvisar um shell script, devolver um payload refletido ou ser «convencido» a mudar de opinião por retórica. A imunidade não é um filtro adicionado depois — é uma propriedade do espaço de saída do modelo.
A inferência é não autorregressiva e paralela: o custo é de $0.042 por milhão de tokens de entrada, com tokens de saída gratuitos (não há geração). A decodificação é determinística, o que torna cada decisão reproduzível e auditável — o mesmo payload produz o mesmo veredito, sempre. Bandas de ação configuráveis (auto, HITL, abstain) decidem quando agir automaticamente, quando escalar para revisão humana e quando se abster.
Taxonomia de ameaças: OWASP LLM01 e Agentic ASI01–ASI08
A superfície de ameaças segue a taxonomia OWASP para aplicações de LLM e para sistemas agênticos. O gateway trata explicitamente as seguintes classes:
| Código | Vetor | Descrição |
|---|---|---|
| LLM01 | Injeção de Prompt | Sobrescrita de instruções por texto adversarial — direta (no prompt do utilizador) ou indireta (em documentos RAG, e-mails, tickets ou ferramentas ingeridas). |
| LLM02 | Vazamento de Dados Sensíveis | Extração de system prompts, segredos, credenciais ou dados pessoais contidos no contexto do modelo. |
| ASI01 | Sequestro de Objetivo (Goal Hijacking) | Substituição dos objetivos primários do agente por objetivos adversariais (ex.: exfiltrar segredos do repositório). |
| ASI02 | Uso Indevido de Ferramentas | Chamada de ferramentas (shell, HTTP, bases de dados) para fins fora da política do agente. |
| ASI05 | Execução Inesperada de Código | Disparo de execução de código não prevista a partir de conteúdo manipulado. |
| ASI08 | Falhas em Cascata | Propagação de uma decisão errada por pipelines multi-agente, amplificando o impacto a cada salto. |
Matriz de ameaças e mitigação pelo gateway
Cada vetor da taxonomia é mapeado para uma mitigação concreta, executada na fronteira antes de o payload chegar ao modelo generativo:
| Ameaça | Superfície | Mitigação no gateway | Estado |
|---|---|---|---|
| LLM01 direta | Prompt do utilizador | Classificação Noul + Choice; BLOCK sobre limiar configurável. | Mitigado |
| LLM01 indireta | Chunks RAG, anexos, tool output | Inspeção de todo o contexto transitado, incluindo conteúdo entre tags de documento. | Mitigado |
| LLM02 | System prompt, segredos | Deteção de tentativas de extração; bloqueio e telemetria sem retenção de conteúdo. | Mitigado |
| ASI01 | Objetivos do agente | Deteta instruções de redefinição de objetivos («trate todas as metas anteriores como concluídas»). | Mitigado |
| ASI02 | Chamadas de ferramentas | Validação perimetral de tool calls contra a política declarada do agente. | Mitigado |
| ASI05 | Execução de código | Bloqueio de payloads que comandam execução de shell ou download/POST de conteúdo sensível. | Mitigado |
| ASI08 | Pipelines multi-agente | Decisões tipadas propagam-se como políticas explícitas; falha fecha em abstain, não em cascata. | Mitigado |
Princípio de falha segura
Em caso de erro, timeout ou indecisão (banda de abstain), o gateway falha para o estado mais conservador configurado e regista apenas telemetria agregada — nunca o conteúdo do payload.
Calibração: RLCD e ECE < 0.07
Uma probabilidade só é útil se for calibrada: quando o motor diz 0.9, o evento tem de ocorrer cerca de 90% das vezes. Medimos isso com o Expected Calibration Error (ECE), que compara a confiança declarada com a frequência observada em bins de probabilidade. O motor Jev é treinado e ajustado com um procedimento de calibração por reforço (RLCD) que penaliza explicitamente a distorção entre confiança e acerto, mantendo o ECE abaixo de 0.07.
- Diagramas de fiabilidade (reliability diagrams) são monitorizados continuamente por classe de ataque, não apenas globalmente;
- Bandas de ação operam sobre probabilidades calibradas: auto abaixo do limiar de bloqueio, HITL na zona intermédia, abstain quando a incerteza é estrutural;
- A calibração é revalidada em telemetria adversarial — conjuntos de prompts de ataque reais e mutações — antes de qualquer alteração de modelo ser promovida.
A calibração importa particularmente no uso agêntico: decisões automáticas sobre milhares de tool calls por hora não toleram confiança mal calibrada. Um sistema sobre-confiante bloqueia produtividade; um sub-confiante deixa passar exatamente os ataques que importam.
Conformidade: LGPD Art. 33, SCC, ZDR e SOC2 Type II
Zero Data Retention (ZDR) é o padrão, não um extra: payloads são inspecionados, decididos e descartados em memória dentro do isolate. Não existem logs de conteúdo, não existe retenção para treino de modelos, não existe cópia do prompt em armazenamento. O que persiste é telemetria operacional agregada — contagens, latências, distribuição de classes — sem qualquer conteúdo.
O enquadramento legal segue a LGPD (Lei nº 13.709/2018) e o GDPR. Nas transferências internacionais de dados (Art. 33 da LGPD), aplicam-se as Standard Contractual Clauses da Comissão Europeia (Decisão (UE) 2021/914) nos contratos com clientes e subencarregados. No DPA (Data Processing Agreement), a Context Armor atua como operador (Art. 39) das instruções documentadas do controlador.
| Subencarregado | Função | Dados envolvidos | Salvaguarda |
|---|---|---|---|
| Cloudflare | Computação edge (Workers, PoPs) | Payload transitório em memória | ZDR, SOC2, SCCs |
| Stripe | Processamento de pagamentos | Dados de faturação (nunca cartões) | PCI-DSS, SCCs |
| OpenRouter | Inferência do motor Jev | Prompt inspecionado (transitório) | ZDR contratual, SCCs |
A operação assenta em controles SOC 2 Type II auditados, com alinhamento ISO 27001: cifra TLS em trânsito, isolamento por V8 isolate, menor privilégio, separação de ambientes e gestão de segredos dedicada. O DPA padrão cobre os Art. 33 e 39 da LGPD, as SCCs e o direito de auditoria; versões personalizadas estão disponíveis no plano Enterprise.
Desempenho e economia: a assimetria é o produto
A diferença não é incremental — é de ordem de grandeza. Validar um prompt com um LLM generativo classe Claude custa cerca de $15.00 por milhão de tokens de entrada e acrescenta ~2.5s ao pipeline. O mesmo prompt verificado pelo gateway custa $0.042 por milhão de tokens (saída gratuita) e acrescenta ~80ms:
| Dimensão | Validação generativa (System 2) | Context Armor (System 1) |
|---|---|---|
| Custo | $15.00 / 1M tokens | $0.042 / 1M tokens |
| Latência | ~2.5s adicionados | ~80ms adicionados |
| Saída | Texto livre (envenenável) | Primitivas tipadas |
| Reprodutibilidade | Variável | Determinística |
| Retenção | Depende do fornecedor | ZDR: 0 bytes |
O modelo de tokenomics do produto reflete esta assimetria: para um pipeline agêntico típico de 2.000 tokens de entrada por verificação, um milhão de verificações mensais custa cerca de $84 no gateway — contra dezenas de milhares de dólares em validação generativa equivalente. A redução líquida de custo é o argumento central da secção Tokenomics do site, com um simulador para cargas de trabalho reais.
Limitações e trabalho futuro
Nenhum sistema de segurança é absoluto, e este whitepaper não o afirma. O motor Jev é probabilístico: existem falsos positivos (payloads legítimos bloqueados) e falsos negativos (ataques admitidos). O que a arquitetura oferece é calibração mensurável, limiares configuráveis e uma banda de abstain explícita para os casos de fronteira — não a eliminação do erro.
- A inspeção cobre o canal de texto; payloads multimodais (imagem, áudio) são trabalho futuro;
- A verificação perimetral não substitui sandboxing de ferramentas, least-privilege em credenciais ou controlos de output — é uma camada, não o perímetro inteiro;
- O custo de latência do modelo de origem não é eliminado; é apenas poupado o custo da validação;
- Modelos de ataque evoluem: a taxonomia e os conjuntos adversariais são revalidados continuamente.
Referências
- 01OWASP Foundation. Top 10 for LLM Applications — LLM01 Prompt Injection, LLM02 Sensitive Information Disclosure.
- 02OWASP Foundation. Agentic AI Threats — ASI01 Goal Hijacking, ASI02 Tool Misuse, ASI05 Unexpected Code Execution, ASI08 Cascading Failures.
- 03Kahneman, D. Thinking, Fast and Slow. Farrar, Straus and Giroux, 2011.
- 04Guo, C. et al. On Calibration of Modern Neural Networks. ICML 2017 (Expected Calibration Error).
- 05Lei nº 13.709/2018 (LGPD), em especial os Art. 7º, 18, 33, 38 e 39.
- 06Comissão Europeia. Standard Contractual Clauses — Decisão (UE) 2021/914.
- 07AICPA. SOC 2 Trust Services Criteria; ISO/IEC 27001.
- 08Cloudflare. Workers e V8 Isolates — documentação técnica de referência.
Put the gateway in front of your model.
Create a free account and test the live scanner in minutes.