discovered 03 Aug 2026
VulnSage
→ View on GitHubVulnSage is an evaluation framework designed to benchmark Large Language Models (LLMs) in zero-shot software vulnerability detection (SVD) using a curated dataset of 593 real-world vulnerabilities categorized across 52 CWE types. It features multi-granular analysis capable of assessing vulnerabilities at function, file, and inter-function levels, alongside four distinct zero-shot prompting strategies for improved reasoning accuracy. Additionally, VulnSage employs a noise quantification methodology to enhance dataset reliability and evaluate LLM robustness against real-world vulnerabilities.