ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
I want to jump on a couple of false dichotomies around LLM speak:
You can have open frontier models, closed Chinese models, open US models, closed non-frontier models (private models make sense!)
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
Falsification Engine: After finding a potential vulnerability, VulnHunter runs a structured reasoning workflow specifically designed to disprove its own argument. It searches for flawed assumptions, logic gaps, or security controls that would block the attack.
Evidence-Backed Remediation: When a defect survives the falsification engine, VulnHunter maps the exact exploit path and generates focused, targeted code changes for review.
Attacker-First Forward Analysis: VulnHunter flips the "sink-first" security model to reduce false positives by simulating a bad actor's exact journey. It begins at potential attacker-accessible entry points (APIs, network messages, file uploads) and reasons forward to evaluate whether an attacker can truly break through.
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
The harness is everything. New tech demo dropped for one way of doing CodeAct agents. Super-efficient. The team even smashed CyberGym while building this - it's now the top-ranking open system for that vulnerability discovery benchmark.
Six core advances:
Links below (blog, report, code)
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
Anonymised analysis of the openai model 'breaching' hugging face:
report doesn't say what sandbox sol broke out of??
a docker container running as root
Plot twist there was no sandbox at all
many use "sandbox" and "container with host access" interchangeably
ymmv, use critical thinking
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
I don't know how many ways to say this but
evidence item #71625: https://developer.nvidia.com/blog/create-a-langchain-deep-agents-harness-profile-for-nvidia-nemotron-3-ultra-to-improve-performance/
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
Solid US-origin open model, congratulations Thinking Machines
https://www.wired.com/story/thinking-machines-lab-releases-its-first-model-inkling/
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲
There are two readings here:
And a very cynical third one:
I think both are valid. But either way, doing the same for less is for some reason attractive to me.
ai & security; research and policy @ big corp. pnw 🏔️🌲
ai & security; research and policy @ big corp. pnw 🏔️🌲