Benchmark registry
Benchmarks
Each benchmark is a versioned set of jurisdiction-specific legal questions with expert-labeled gold standards. A small sample is released publicly; the majority is held out and used only inside paid engagements, so systems can't train on the test.
MiCA-BenchEUv1.0.0-draftdraft — under legal reviewThe standard for evaluating AI reasoning on EU digital-asset and financial regulation. Covers: scope, art_emt, casp, whitepaper, market_abuse, stablecoin_reserves.DPA-BenchUKv1.0.0-draftdraft — under legal reviewThe standard for evaluating AI reasoning on UK data protection law. Covers: lawful_basis, processors, rights, breach, transfers, marketing.VARA-BenchUAEv1.0.0-draftdraft — under legal reviewThe standard for evaluating AI reasoning on UAE virtual-asset and DIFC commercial law. Covers: vara_licensing, federal_layer, difc_contract, difc_employment, difc_data, jurisdiction_map.
Benchmarks marked draft are Claude-drafted and pending review by a practising lawyer before use in any paid engagement — the review gate is part of the published methodology. Versions are immutable once released; changes ship as a new version.