Public benchmark

Held-out challenge retrieval

Measured with v1.1.9 (2026-07-09).

Profile sota-challenge: 600 public queries (executed model unverified) across 6 public CoIR tasks, repeated 3 times. No private corpus or local path is included.

Corpus sampling: 6 of 6 corpora sampled to 5,000 documents (qrel documents retained, remainder dropped deterministically). Full CoIR corpora: stackoverflow-qa 19,931 documents (5,000 indexed), apps 8,765 documents (5,000 indexed), codefeedback-mt 66,383 documents (5,000 indexed), synthetic-text2sql 105,851 documents (5,000 indexed), CodeSearchNet-python 280,310 documents (5,000 indexed), CodeSearchNet-java 180,866 documents (5,000 indexed). Scores on sampled corpora are not comparable to full-corpus CoIR leaderboard numbers.

600public queries (executed model unverified)
6public tasks
3languages
3repetitions
6/6corpora sampled
2048query char limit

Aggregate results

ModenDCG@10MRR@10P@5R@20Warm p95Index size
hash0.59000.55820.12870.7000688.94 ms45.43 MiB
hybrid0.58960.55780.12870.7000722.46 ms45.45 MiB
blended0.59550.56520.13000.7000778.19 ms65.54 MiB
neural0.59630.56610.13030.7000798.38 ms65.55 MiB

Population variance, phase timings, peak RSS, binary identity, dataset revisions, and checksums are retained in the raw JSON.

Per-task quality

TaskModenDCG@10MRR@10R@20
stackoverflow-qahash0.58290.52310.7700
stackoverflow-qahybrid0.58100.52060.7700
stackoverflow-qablended0.59880.54580.7700
stackoverflow-qaneural0.59880.54580.7700
appshash0.00330.00140.0200
appshybrid0.00330.00140.0200
appsblended0.00330.00140.0200
appsneural0.00330.00140.0200
codefeedback-mthash0.56570.51120.7600
codefeedback-mthybrid0.56570.51120.7600
codefeedback-mtblended0.57880.52430.7600
codefeedback-mtneural0.57880.52430.7600
synthetic-text2sqlhash0.86620.83660.9800
synthetic-text2sqlhybrid0.86620.83660.9800
synthetic-text2sqlblended0.86580.83300.9800
synthetic-text2sqlneural0.86830.83630.9800
CodeSearchNet-pythonhash0.94000.94000.9400
CodeSearchNet-pythonhybrid0.94000.94000.9400
CodeSearchNet-pythonblended0.94000.94000.9400
CodeSearchNet-pythonneural0.94000.94000.9400
CodeSearchNet-javahash0.58160.53700.7300
CodeSearchNet-javahybrid0.58160.53700.7300
CodeSearchNet-javablended0.58650.54650.7300
CodeSearchNet-javaneural0.58850.54880.7300

Every retained task remains visible so aggregate improvements cannot hide regressions.

Scope

Matrix covers natural-language and code-to-code retrieval. Exact-search tools require a separate exact-query workload.

This artifact does not record verified checkout-reference fit-ID disjointness. Executed-model fit disjointness is unverified: no model-checksum attestation binds the binary to the reference. Matching model IDs do not identify model bytes. This diagnostic does not replace the public-core release gate.

Corpus sampling: 6 of 6 corpora sampled to 5,000 documents (qrel documents retained, remainder dropped deterministically). Full CoIR corpora: stackoverflow-qa 19,931 documents (5,000 indexed), apps 8,765 documents (5,000 indexed), codefeedback-mt 66,383 documents (5,000 indexed), synthetic-text2sql 105,851 documents (5,000 indexed), CodeSearchNet-python 280,310 documents (5,000 indexed), CodeSearchNet-java 180,866 documents (5,000 indexed). Scores on sampled corpora are not comparable to full-corpus CoIR leaderboard numbers.

Artifacts use pinned public datasets and retain source revisions and checksums in raw JSON. Deterministic samples: stackoverflow-qa (100 queries, 5000 documents), apps (100 queries, 5000 documents), codefeedback-mt (100 queries, 5000 documents), synthetic-text2sql (100 queries, 5000 documents), CodeSearchNet-python (100 queries, 5000 documents), CodeSearchNet-java (100 queries, 5000 documents). Dataset cards do not declare licenses for: stackoverflow-qa, apps, codefeedback-mt, synthetic-text2sql. Treat downloaded corpora as evaluation inputs; do not redistribute them without checking upstream terms.