Public benchmark

Code-retrieval quality and cost

Profile public-core: 1000 held-out queries across 4 public CoIR tasks, repeated 3 times. No private corpus or local path is included.

1000held-out queries
4public tasks
50languages
3repetitions

Aggregate results

ModenDCG@10MRR@10P@5R@20Warm p95Index size
blended0.26250.21670.06050.4683238.82 ms91.14 MiB
neural0.26330.21780.06080.4690242.35 ms91.14 MiB

Population variance, phase timings, peak RSS, binary identity, dataset revisions, and checksums are retained in the raw JSON.

Change from frozen baseline

neural improves nDCG@10 by +13.31% and MRR@10 by +13.21% over hash at commit 49b1571de77a. The raw JSON retains every task and run.

Per-task quality

TaskModenDCG@10MRR@10R@20
codetrans-dlblended0.22590.13960.5648
codetrans-dlneural0.22900.14350.5722
codetrans-contestblended0.37770.33920.5068
codetrans-contestneural0.37780.33930.5068
cosqablended0.15010.11270.3633
cosqaneural0.15050.11350.3620
codefeedback-stblended0.63940.60830.7374
codefeedback-stneural0.63940.60830.7374

Every retained task remains visible so aggregate improvements cannot hide regressions.

Scope

Matrix covers held-out natural-language and code-to-code retrieval. Exact-search tools require a separate exact-query workload.

Artifacts use pinned public datasets and retain source revisions and checksums in raw JSON. Deterministic samples: codefeedback-st (99 queries, 5000 documents). Dataset cards do not declare licenses for: codetrans-dl, codetrans-contest, cosqa, codefeedback-st. Treat downloaded corpora as evaluation inputs; do not redistribute them without checking upstream terms.