02 / AI SYSTEMS · MULTI-OBJECTIVE SEARCH

Foundry.

Compare AI routing options against a quality target, latency limit, and budget.

81 strategies computedHYPOTHETICAL EVALUATIONS
99%$0.0092%$1.4585%$2.9077%$4.3570%$5.80local/local/local/local: $0.00 / 1k, 75.3% expected pass, 295 ms meanlocal/local/local/balanced: $0.12 / 1k, 76.1% expected pass, 334 ms meanlocal/local/local/deep: $0.58 / 1k, 76.5% expected pass, 514 ms meanlocal/local/balanced/local: $0.24 / 1k, 80.3% expected pass, 499 ms meanlocal/local/balanced/balanced: $0.36 / 1k, 81.1% expected pass, 538 ms meanlocal/local/balanced/deep: $0.82 / 1k, 81.5% expected pass, 718 ms meanlocal/local/deep/local: $1.16 / 1k, 83.1% expected pass, 1259 ms meanlocal/local/deep/balanced: $1.28 / 1k, 83.9% expected pass, 1298 ms meanlocal/local/deep/deep: $1.74 / 1k, 84.3% expected pass, 1478 ms meanlocal/balanced/local/local: $0.36 / 1k, 81.9% expected pass, 499 ms meanlocal/balanced/local/balanced: $0.48 / 1k, 82.7% expected pass, 538 ms meanlocal/balanced/local/deep: $0.94 / 1k, 83.1% expected pass, 718 ms meanlocal/balanced/balanced/local: $0.60 / 1k, 86.9% expected pass, 703 ms meanlocal/balanced/balanced/balanced: $0.72 / 1k, 87.7% expected pass, 742 ms meanlocal/balanced/balanced/deep: $1.18 / 1k, 88.1% expected pass, 922 ms meanlocal/balanced/deep/local: $1.52 / 1k, 89.7% expected pass, 1463 ms meanlocal/balanced/deep/balanced: $1.64 / 1k, 90.5% expected pass, 1502 ms meanlocal/balanced/deep/deep: $2.10 / 1k, 90.9% expected pass, 1682 ms meanlocal/deep/local/local: $1.74 / 1k, 84.6% expected pass, 1429 ms meanlocal/deep/local/balanced: $1.86 / 1k, 85.4% expected pass, 1468 ms meanlocal/deep/local/deep: $2.32 / 1k, 85.8% expected pass, 1648 ms meanlocal/deep/balanced/local: $1.98 / 1k, 89.6% expected pass, 1633 ms meanlocal/deep/balanced/balanced: $2.10 / 1k, 90.4% expected pass, 1672 ms meanlocal/deep/balanced/deep: $2.56 / 1k, 90.8% expected pass, 1852 ms meanlocal/deep/deep/local: $2.90 / 1k, 92.4% expected pass, 2393 ms meanlocal/deep/deep/balanced: $3.02 / 1k, 93.2% expected pass, 2432 ms meanlocal/deep/deep/deep: $3.48 / 1k, 93.6% expected pass, 2612 ms meanbalanced/local/local/local: $0.48 / 1k, 76.9% expected pass, 415 ms meanbalanced/local/local/balanced: $0.60 / 1k, 77.7% expected pass, 454 ms meanbalanced/local/local/deep: $1.06 / 1k, 78.1% expected pass, 634 ms meanbalanced/local/balanced/local: $0.72 / 1k, 81.9% expected pass, 619 ms meanbalanced/local/balanced/balanced: $0.84 / 1k, 82.7% expected pass, 658 ms meanbalanced/local/balanced/deep: $1.30 / 1k, 83.1% expected pass, 838 ms meanbalanced/local/deep/local: $1.64 / 1k, 84.7% expected pass, 1379 ms meanbalanced/local/deep/balanced: $1.76 / 1k, 85.5% expected pass, 1418 ms meanbalanced/local/deep/deep: $2.22 / 1k, 85.9% expected pass, 1598 ms meanbalanced/balanced/local/local: $0.84 / 1k, 83.5% expected pass, 619 ms meanbalanced/balanced/local/balanced: $0.96 / 1k, 84.3% expected pass, 658 ms meanbalanced/balanced/local/deep: $1.42 / 1k, 84.7% expected pass, 838 ms meanbalanced/balanced/balanced/local: $1.08 / 1k, 88.5% expected pass, 823 ms meanbalanced/balanced/balanced/balanced: $1.20 / 1k, 89.3% expected pass, 862 ms meanbalanced/balanced/balanced/deep: $1.66 / 1k, 89.7% expected pass, 1042 ms meanbalanced/balanced/deep/local: $2.00 / 1k, 91.3% expected pass, 1583 ms meanbalanced/balanced/deep/balanced: $2.12 / 1k, 92.1% expected pass, 1622 ms meanbalanced/balanced/deep/deep: $2.58 / 1k, 92.5% expected pass, 1802 ms meanbalanced/deep/local/local: $2.22 / 1k, 86.2% expected pass, 1549 ms meanbalanced/deep/local/balanced: $2.34 / 1k, 87.0% expected pass, 1588 ms meanbalanced/deep/local/deep: $2.80 / 1k, 87.4% expected pass, 1768 ms meanbalanced/deep/balanced/local: $2.46 / 1k, 91.2% expected pass, 1753 ms meanbalanced/deep/balanced/balanced: $2.58 / 1k, 92.0% expected pass, 1792 ms meanbalanced/deep/balanced/deep: $3.04 / 1k, 92.4% expected pass, 1972 ms meanbalanced/deep/deep/local: $3.38 / 1k, 94.0% expected pass, 2513 ms meanbalanced/deep/deep/balanced: $3.50 / 1k, 94.8% expected pass, 2552 ms meanbalanced/deep/deep/deep: $3.96 / 1k, 95.2% expected pass, 2732 ms meandeep/local/local/local: $2.32 / 1k, 77.7% expected pass, 1063 ms meandeep/local/local/balanced: $2.44 / 1k, 78.5% expected pass, 1102 ms meandeep/local/local/deep: $2.90 / 1k, 78.9% expected pass, 1282 ms meandeep/local/balanced/local: $2.56 / 1k, 82.7% expected pass, 1267 ms meandeep/local/balanced/balanced: $2.68 / 1k, 83.5% expected pass, 1306 ms meandeep/local/balanced/deep: $3.14 / 1k, 83.9% expected pass, 1486 ms meandeep/local/deep/local: $3.48 / 1k, 85.5% expected pass, 2027 ms meandeep/local/deep/balanced: $3.60 / 1k, 86.3% expected pass, 2066 ms meandeep/local/deep/deep: $4.06 / 1k, 86.7% expected pass, 2246 ms meandeep/balanced/local/local: $2.68 / 1k, 84.3% expected pass, 1267 ms meandeep/balanced/local/balanced: $2.80 / 1k, 85.1% expected pass, 1306 ms meandeep/balanced/local/deep: $3.26 / 1k, 85.5% expected pass, 1486 ms meandeep/balanced/balanced/local: $2.92 / 1k, 89.3% expected pass, 1471 ms meandeep/balanced/balanced/balanced: $3.04 / 1k, 90.1% expected pass, 1510 ms meandeep/balanced/balanced/deep: $3.50 / 1k, 90.5% expected pass, 1690 ms meandeep/balanced/deep/local: $3.84 / 1k, 92.1% expected pass, 2231 ms meandeep/balanced/deep/balanced: $3.96 / 1k, 92.9% expected pass, 2270 ms meandeep/balanced/deep/deep: $4.42 / 1k, 93.3% expected pass, 2450 ms meandeep/deep/local/local: $4.06 / 1k, 87.0% expected pass, 2197 ms meandeep/deep/local/balanced: $4.18 / 1k, 87.8% expected pass, 2236 ms meandeep/deep/local/deep: $4.64 / 1k, 88.2% expected pass, 2416 ms meandeep/deep/balanced/local: $4.30 / 1k, 92.0% expected pass, 2401 ms meandeep/deep/balanced/balanced: $4.42 / 1k, 92.8% expected pass, 2440 ms meandeep/deep/balanced/deep: $4.88 / 1k, 93.2% expected pass, 2620 ms meandeep/deep/deep/local: $5.22 / 1k, 94.8% expected pass, 3161 ms meandeep/deep/deep/balanced: $5.34 / 1k, 95.6% expected pass, 3200 ms meandeep/deep/deep/deep: $5.80 / 1k, 96.0% expected pass, 3380 ms meanEXPECTED PASS RATEESTIMATED COST PER 1,000 TASKS13 nondominated options
Within all constraints Tradeoff outside constraints Your cost / quality limitsEach point is a complete routing policy
Feasible strategies15Of 81 combinations
Best feasible pass rate92.4%Weighted by workload mix
Best policy cost$2.90Per 1,000 modeled tasks
Expected mean latency2393 msWeighted mean, not tail latency
These profiles are hypothetical, with invented example measurements. Replace the table with your evaluations to make a real routing decision.

Inspect a strategy

Issue triage Local small
Code changes Deep reasoning
Design review Deep reasoning
Private context Local small

This policy meets your current limits. Nondominated means no other eligible policy improves one of the three objectives without worsening another.

The evidence behind the points

No named model gets an invented benchmark here. The starter table uses fictional profiles. Quality is an observed task pass rate when you supply your own rows.

Task / profilePassMean$/1kn
triage / local91%180 ms0100
triage / balanced95%480 ms1.2100
triage / deep97%2100 ms5.8100
code / local65%420 ms0100
code / balanced87%1100 ms1.2100
code / deep96%4200 ms5.8100
review / local55%380 ms0100
review / balanced80%1400 ms1.2100
review / deep94%5200 ms5.8100
secrets / local84%210 ms0100
secrets / balanced92%600 ms1.2100
secrets / deep96%2400 ms5.8100

Use your evaluation results

Paste the same schema with a row for every task/profile pair. Set source to user-supplied. Costs, latency and pass rates should come from comparable held-out evaluations.

Smarter allocation, with visible assumptions

The search enumerates all category-to-profile assignments, then compares cost, expected pass rate, and mean latency. It does not train a router, call paid models, predict tail latency, or establish statistical confidence. A zero API price for a local profile excludes hardware and electricity. Routing research such as RouteLLM motivates the tradeoff; the results shown here come only from this table. Re-evaluate on fresh tasks before using a policy in production.

The person behind the project

A note from Luis.

My coding-agent evaluation work makes me interested in what an AI system can demonstrate, including where it fails. This notebook exposes the quality, cost, and latency assumptions. Its starting model profiles are hypothetical, not a benchmark I have measured.

Who it helps

Engineers comparing the tradeoffs of AI routing policies.

Try this

Change the quality target or budget and inspect why a routing option becomes infeasible.

Inspect a reproducible system handoff