I don't know how many ways to say this but
- stop looking at model performance
- it's almost all in the harness
- decent harness can easily outclass top model
evidence item #71625: https://developer.nvidia.com/blog/create-a-langchain-deep-agents-harness-profile-for-nvidia-nemotron-3-ultra-to-improve-performance/