Pular para conteúdo

ADR 0001: Adoção da NVIDIA NIM API e Arquitetura Multi-Provedor Antissicofancia

  • Status: Aceito
  • Data: 2026-08-30
  • Decisores: Usuário, Gemini / Antigravity, Claude Code

1. Contexto

O Conselho de IA é projetado para atuar como um conselho de administração adversarial (Red Teaming), combatendo o viés de concordância (Yes-Man Bias / Sycophancy) inerente a LLMs alinhados convencionalmente.

Para que o conselho funcione com rigor real: 1. As 5 personas (Advogado do Diabo, CFO, COO, CMO e Árbitro) não podem ser cópias homogêneas de um único modelo na mesma chamada, pois compartilhariam os mesmos pontos cegos e vieses de treinamento. 2. A Fase 1 de crítica deve ter isolamento estrito de contexto, executando concorrentemente para que a opinião de uma persona não contamine as outras. 3. Precisamos de inferência de alto throughput e baixa latência para disparar múltiplos modelos em paralelo sem estourar custos ou timeouts.

2. Decisão

Adotamos a NVIDIA NIM API (build.nvidia.com / https://integrate.api.nvidia.com/v1) como o hub prioritário de inferência acelerada por GPU, combinada com uma arquitetura agnóstica multi-provedor (src/core/llm_client.py).

Matriz de Atribuição Padrão de Modelos:

  • 🔴 Advogado do Diabo: nvidia/llama-3.1-nemotron-70b-instruct (calibrado para raciocínio crítico e detecção de riscos).
  • 💰 CFO: meta/llama-3.3-70b-instruct ou deepseek-ai/deepseek-r1 (precisão analítica e unit economics).
  • ⚙️ COO: mistralai/mistral-large-2-instruct (foco pragmático em operações e sistemas).
  • 🎯 CMO: meta/llama-3.3-70b-instruct (visão de mercado e cliente).
  • ⚖️ Árbitro: nvidia/llama-3.1-nemotron-70b-instruct (estruturação de JSON e ponderação imparcial de risco).

3. Consequências

Positivas:

  • Diversidade Real de Raciocínio: Diferentes famílias de modelos (Nemotron, Llama, Mistral, DeepSeek) debatendo a mesma tese.
  • Isolamento Concorrente: Execução assíncrona via asyncio.gather garantindo zero contaminação cruzada na Fase 1.
  • Portabilidade: Transição suave da API em nuvem (build.nvidia.com) para deploy local de containers NIM no servidor Hub (Ampere) quando necessário.
  • Contratos Fortemente Tipados: Validação Pydantic V2 em todas as etapas, com emissão de dossiês em Markdown e JSON.

Mitigações:

  • Caso o usuário não disponha de NVIDIA_API_KEY imediata, o motor possui modo simulado (--mock) e suporte a outros provedores (OpenAI, Anthropic, Gemini).