Nos anos 90, a Internet era uma tecnologia que oferecia muitas possibilidades e ao mesmo tempo, ela também trazia os seus riscos! Felizmente, ela se tornou a base de uma economia inteira, quando ganhou uma camada de segurança essencial para o seu uso no dia-a-dia: as conexões criptografadas e (principalmente), o isolamento de cada página em seu próprio sandbox (a aba do navegador). Embora a segurança que tenha trazido algumas restrinções quanto ao seu desenvolvimento, isto não significa que ela freou a inovação. E novamente estamos vendo estes ciclos acontecerem de novo, através da ascensão dos agentes de IA…
“To understand where agentic AI stands today, consider the last seismic shift in technology: the rise of the internet in the 90s. It was new and full of possibilities. You could build a website over a weekend and share it with the world, or chat with someone half way around the world in online chat rooms without long-distance telephone fees. It brought endless opportunity, but also a lot of risk. A website could run code on your machine, steal your sensitive information, or infect your computer with a virus. People loved it anyway.”
— by Nvidia (Technical Blog).
Recentemente, tivemos alguns relatos de agentes em laboratórios que escaparam dos ambientes de avaliação (criados para contê-los), chegando a sistemas que não deveriam alcançar. Inclusive, alguns chegaram a descrever de forma incorreta o que tinham feito. Segundo a Nvidia, isto não veio de uma única capacidade nova, mas da combinação de ferramentas, tempo e instruções ambíguas, que trouxeram as condições ideais para que isto possa acontecer. Eis, a conclusão da empresa: a segurança dos agentes exige controles independentes, assim como os navegadores web passaram a desconfiar do código das páginas que deveriam renderizar.
A partir da experiência com o OpenShell, runtime de código aberto (Apache 2.0) que executa agentes em sandboxes com isolamento no nível do kernel, a empresa apresenta o conceito de drift: ações do agente que se afastam da tarefa ou das restrições originais. Isso pode ser provocado por um bloqueio de política, um bug, uma ferramenta ausente, instruções ambíguas ou execuções de dias ou semanas em que as primeiras mil tentativas falham. Isto não pode ser eliminado por treinamento sem perdas da capacidade, pois os agente nessas condições não pode ser responsável por governar o próprio comportamento.
Para resolver este problema, a Nvidia estabelece cinco princípios essenciais: a política verificável antes da execução, a aplicação fora da banda (o agente não precisa saber que está sendo observado), o controle do caminho até o modelo como ponto de observação e o “botão de desligar”, trazendo assim a visibilidade do raciocínio proporcional à autoridade do agente de IA, além de um modelo de responsabilidade compartilhada entre laboratórios, empresas e fornecedores de hardware. Eis, a solução Open Agent Safety Platform!
Na arquitetura, a plataforma possui três camadas, a saber: a aplicação (modelos, ferramentas, dados), o runtime (orquestração, monitoramento contínuo e aplicação de políticas em tempo real) e a infraestrutura (hardware). O OpenShell define e verifica quais arquivos, redes, ferramentas, processos e credenciais cada agente pode acessar. Para quem quer uma camada independente adicional, o Nvidia Sentry estende o monitoramento e a aplicação das regras para o hardware BlueField, usando o DOCA para correlacionar interações do agente, decisões de política e acesso a ferramentas e dados. Com isto, é possível detectar drift e investigar comportamentos suspeitos, além do gateway DOCA ainda verificar continuamente, a identidade e a autoridade delegada de cada agente de IA.
Em escala de fábrica de IA, a plataforma é otimizada para sistemas com CPUs Vera e DPUs BlueField, embora a empresa afirme que ela é compatível com outros hardwares. Nos Vera Rubin PODs, cada bandeja de computação tem um BlueField-4 no único caminho até o modelo, isolado do host e fora do alcance do agente, o que permite observação contínua e aplicação de políticas em velocidade de linha, mesmo quando o host não é confiável. Para quem já usa Vera com BlueField-4, ativar estas proteções poderia ser feito apenas com uma atualização de software! Por isto, a empresa faz um convite aos laboratórios, desenvolvedores e provedores de infraestrutura, para construir a “camada de confiança” da economia de agentes, com apoio das empresas que já fazem parte deste ecossistema.
Um ecossistema que vale notar, a Intel e a AMD não estão participando… &;-D