JS 1.0 · Interactive explorer

Test the published conclusions against the evidence

Filter configurations and projects, move between guided analytical views, compare up to four configurations, and share deterministic explorer state.

Snyk VulnBench JS 1.0

JS 1.0 explorer

Dataset
1.0.0
View
Summary
Filters
0 active filters
Records
300 represented runs
Metric
f1
Aggregation
mean
View share cardDataMethodology

Published default view

Configuration summary

Compare Snyk-reference agreement, repeated-run spread, coverage, and resource use under the active project and configuration filters.

Published configuration scorecard. Activate a metric heading to sort.
Configuration
Snyk Code SASTDeterministic reference reproduction100.0%0.0 pp100.0%100.0%14.8 s0N/A
Claude Opus 4.6 MediumModel via agentic harness75.4%0.2 pp68.0%91.5%27.3 s51,574$0.063
Claude Opus 4.6 HighModel via agentic harness75.2%0.3 pp68.2%89.8%53.8 s66,929$0.125
Claude Opus 4.7 MaxModel via agentic harness68.8%2.2 pp71.4%69.6%37.4 s95,969$0.356
Claude Sonnet 4.6 MediumModel via agentic harness67.4%0.9 pp80.9%62.6%59.3 s56,992$0.086
Claude Sonnet 4.6 HighModel via agentic harness64.9%3.5 pp81.3%58.6%94.8 s74,240$0.132

Macro average across 10 fixtures and 5 repetitions · Dataset 1.0.0 · Snyk VulnBench JS 1.0

Interpretation boundary: Snyk Code’s 100% row is deterministic reproduction of the reference set it defines. It is not a universal accuracy result.

Agreement versus repeated-run varianceAgreement versus repeated-run variance64.9%73.7%82.4%91.2%100.0%0.0 pp0.9 pp1.7 pp2.6 pp3.5 ppF1 standard deviation (percentage points)Snyk-reference F1 (%)

Snyk Code SASTF1 standard deviation: 0.0 ppSnyk-reference F1: 100.0%

ConfigurationF1 standard deviationSnyk-reference F1
Snyk Code SAST0.0 pp100.0%
Claude Opus 4.6 Medium0.2 pp75.4%
Claude Opus 4.6 High0.3 pp75.2%
Claude Opus 4.7 Max2.2 pp68.8%
Claude Sonnet 4.6 Medium0.9 pp67.4%
Claude Sonnet 4.6 High3.5 pp64.9%

Upper-left means higher Snyk-reference agreement and lower repeated-run variance.

Caveat: Reference agreement is not universal vulnerability-detection accuracy.

Snyk VulnBench JS 1.0 · Dataset 1.0.0 · Macro average across 10 fixtures and 5 repetitions · Source /data/js-1.0/published-evidence.json

Headline recurrence

Stable reference matches contrast with variable unmatched reports across identical runs. This release-wide context is not changed by active project or configuration filters.

Cost versus Snyk-reference F1Cost versus Snyk-reference F164.9%67.5%70.1%72.8%75.4%$0.063$0.136$0.209$0.283$0.356Estimated model-session cost (USD)Snyk-reference F1 (%)

Claude Opus 4.6 MediumEstimated model-session cost: $0.063Snyk-reference F1: 75.4%

ConfigurationEstimated model-session costSnyk-reference F1
Claude Opus 4.6 Medium$0.06375.4%
Claude Opus 4.6 High$0.12575.2%
Claude Opus 4.7 Max$0.35668.8%
Claude Sonnet 4.6 Medium$0.08667.4%
Claude Sonnet 4.6 High$0.13264.9%

Upper-left means higher Snyk-reference agreement at lower estimated cost.

Caveat: Costs reflect small fixtures and published model-session assumptions.

Snyk VulnBench JS 1.0 · Dataset 1.0.0 · Macro average across 10 fixtures and 5 repetitions · Source /data/js-1.0/published-evidence.json

Compare

0 pinned

Pin up to four configurations from a view to compare agreement, repeatability, and resource use.