Ficha · confiança medium

Tipo: pessoa

Empresa: Gray Swan AI

Papel: cofundador e Chief Scientist

Github status: nao_encontrado

Origem nome: wiki/empresas/gray-swan.md

X handle: zicokolter

X prova: Professor and Head of Machine Learning Department at @CarnegieMellon. Board member @OpenAI and @Qualcomm. Chief Scientist @GraySwanAI.

X status: confirmado

Síntese

Zico Kolter é cofundador e Chief Scientist da Gray Swan AI, segundo a ficha da empresa e o perfil confirmado no X. (https://wing.vc/content/investing-in-gray-swan-the-ai-security-platform-that-every-frontier-lab-trusts) (https://x.com/zicokolter)

Ele também se apresenta como professor e Head of Machine Learning Department da Carnegie Mellon e membro dos boards da OpenAI e da Qualcomm. (https://x.com/zicokolter)

A tese pessoal mais desenvolvida na timeline trata a segurança de IA como um processo iterativo: modelos são submetidos a testes adversariais públicos, corrigidos e novamente atacados, com progresso medido em graus de resistência prática. (https://x.com/zicokolter/status/1813953859875680543)

Em 2026, ele vinculou essa tese ao risco de prompt injection em agentes com maior autonomia e acesso a informação não confiável. (https://x.com/zicokolter/status/2035100860212981994)

Trajetória

A Gray Swan AI foi fundada em 2023 como spinout da Carnegie Mellon University. (https://technical.ly/entrepreneurship/gray-swan-ai-security-40m-series-a/)

Kolter anunciou o lançamento público da Gray Swan em julho de 2024 com Matt Fredrikson, Andy Zou e Dan Hendrycks. (https://x.com/zicokolter/status/1813260586895175696)

Dois dias após esse anúncio, ele se descreveu como Chief Technical Advisor da empresa em uma reflexão sobre o jailbreak do modelo Cygnet. (https://x.com/zicokolter/status/1813953859875680543)

A ficha atual da empresa o identifica como cofundador e Chief Scientist, cargo também presente na bio coletada do X. (https://wing.vc/content/investing-in-gray-swan-the-ai-security-platform-that-every-frontier-lab-trusts) (https://x.com/zicokolter)

Em junho de 2024, ele anunciou que se tornaria diretor do Machine Learning Department da Carnegie Mellon. (https://x.com/zicokolter/status/1800153462078140592)

Em agosto de 2024, anunciou sua entrada no board da OpenAI com foco declarado em AI safety e robustez. (https://x.com/zicokolter/status/1821623357315674499)

A bio coletada também declara participação no board da Qualcomm. (https://x.com/zicokolter)

Empregador anterior confirmado pelo corpus: não encontrado.

Exit empresarial anterior: não encontrado.

Unidade militar: não encontrado.

O que ele publica

A timeline coletada contém 60 posts entre 19/10/2021 e 02/09/2026. (https://x.com/zicokolter/status/1450288313504575490) (https://x.com/zicokolter/status/2095111792766722303)

A distribuição anual da amostra é irregular: 1 post em 2021, 18 em 2022, 8 em 2023, 20 em 2024, 3 em 2025 e 10 em 2026 até 02/09. (https://x.com/zicokolter)

O método de seleção dos 60 posts e a cobertura em relação aos 681 tweets indicados pelo perfil: não encontrado.

A classificação manual abaixo atribui um tema principal a cada post, sem dupla contagem, e fecha os 60 posts coletados. (https://x.com/zicokolter)

O formato mais frequente combina comentário curto, anúncio ou chamada com link: 31 dos 60 posts contêm ao menos um link encurtado no texto. (https://x.com/zicokolter)

Oito posts são aberturas explícitas de thread, marcadas por 🧵, 1/N, [1/n] ou 1/. (https://x.com/zicokolter/status/2035100860212981994) (https://x.com/zicokolter/status/1745135410353672392) (https://x.com/zicokolter/status/1485800009098575875)

Um post aparece explicitamente como repost com o prefixo RT. (https://x.com/zicokolter/status/2095111792766722303)

Anúncios recorrentes divulgam cursos, papers, conferências, cargos e funding. (https://x.com/zicokolter/status/2007915113387302928) (https://x.com/zicokolter/status/1684500094106968065) (https://x.com/zicokolter/status/2060035374613713312)

A conta funciona sobretudo como canal pessoal de pesquisa e academia; seis dos 60 posts mencionam explicitamente a Gray Swan AI. (https://x.com/zicokolter/status/2069174854444573125) (https://x.com/zicokolter/status/1813260586895175696)

Teses datadas

Prompt injection como risco central de agentes autônomos

Kolter associa maior autonomia e acesso a informação não confiável ao crescimento do risco de prompt injection. (https://x.com/zicokolter/status/2035100860212981994)

As AI agents access more untrusted information with greater autonomy, prompt injections may become the greatest security challenge of our era.

Data: 20/03/2026 | Post: https://x.com/zicokolter/status/2035100860212981994

Segurança de LLMs como iteração contínua

Após o jailbreak do Cygnet, Kolter apresentou confiabilidade de deployment como condição para escala e defendeu ciclos sucessivos de correção e novos ataques. (https://x.com/zicokolter/status/1813953859875680543)

I believe that reliable deployment of LLMs is going to be the crucial factor in determining how they scale in deployment, and I also believe that the only way to do this is to iterate until we get there. We’ll be updating the models in response to the breaks, they’ll get broken again, and hopefully this gets us to a better place in the end.

Data: 18/07/2024 | Post: https://x.com/zicokolter/status/1813953859875680543

Segurança em graus, com referência ao padrão de software

Kolter defendeu a utilidade de comparar graus de segurança, mesmo quando modelos continuam quebráveis por adversários. (https://x.com/zicokolter/status/1813953859875680543)

I think that for now it’s reasonable to talk about degrees of AI safety and security. This is the standard in software, where many systems are known to be likely exploitable by an adversary with sufficient resources, but the goal is to constantly react/patch to make the system secure to practical threats.

Data: 18/07/2024 | Post: https://x.com/zicokolter/status/1813953859875680543

Benchmarks de safety centrados em tarefas de agentes

Kolter pediu benchmarks que avaliem tarefas reais executadas por agentes, ampliando o foco além de consultas nocivas. (https://x.com/zicokolter/status/1845797926783578120)

Really important to have safety benchmarks that move beyond harmful queries to actual agent tasks.

Data: 14/10/2024 | Post: https://x.com/zicokolter/status/1845797926783578120

Geração útil quando a verificação é fácil

Kolter situou a utilidade de modelos generativos nos problemas em que criar é difícil e verificar é fácil. (https://x.com/zicokolter/status/1627404342763429888)

An important point that seems missing (as far as I’ve seen) in the debate over LLM “correctness” / “usefulness”: generative models are most useful precisely in situations where creation is hard, but verification is easy. 1/N

Data: 19/02/2023 | Post: https://x.com/zicokolter/status/1627404342763429888

Memorização medida por prompts adversariais

Kolter defendeu maior nuance na definição de memorização e propôs o tamanho relativo do prompt adversarial como métrica. (https://x.com/zicokolter/status/1783576092885848572)

There’s been a lot of discussion on LLMs “memorizing” training data, but we argue for more nuance in the definition of “memorize”. This work advocates for adversarial prompts (and whether they can be shorter than the output) as a metric for assessing memorization.

Data: 25/04/2024 | Post: https://x.com/zicokolter/status/1783576092885848572

Presença técnica

Perfil confirmado no GitHub: não encontrado.

Repositórios próprios: não encontrado.

Linguagem dominante: não encontrado.

Contribuições públicas: não encontrado.

Atividade recente: não encontrado.

Ângulo de audit

Interlocutor possível para red teaming e avaliação de sistemas de IA por seu papel de cofundador e Chief Scientist; evidência de que compra auditoria externa: não encontrado. (https://wing.vc/content/investing-in-gray-swan-the-ai-security-platform-that-every-frontier-lab-trusts)

O que NÃO se sabe

  • Formação acadêmica e trajetória anterior à Carnegie Mellon: não encontrado.

  • Empregadores e cargos anteriores confirmados: não encontrado.

  • Exit empresarial anterior: não encontrado.

  • Unidade militar ou serviço público: não encontrado.

  • Data e razão da mudança de Chief Technical Advisor para Chief Scientist: não encontrado.

  • Escopo executivo, tamanho do time e orçamento sob responsabilidade na Gray Swan AI: não encontrado.

  • Escopo de suas funções nos boards da OpenAI e da Qualcomm: não encontrado.

  • Autoridade direta para contratar audit, pentest ou consultoria independente: não encontrado.

  • Perfil confirmado no GitHub, repositórios, linguagens, contribuições e atividade recente: não encontrado.

  • LinkedIn confirmado: não encontrado.

  • Regra de coleta e cobertura dos 60 posts diante dos 681 tweets indicados no perfil: não encontrado.