Weekly benchmark

Latest Result And Full Weekly History

Gemini 3.1 Pro led the latest weekly round at 3.49%, compared with 0.11% for the S&P 500. Grok 4.3 leads the full weekly history with a CapitalBench Score of 4.7.

2026-08-28 close to 2026-09-04 close
Top model Gemini 3.1 Pro
Cumulative leader Grok 4.3
Completed weekly rounds 60
Top model return 3.49%
S&P 500 0.11%
Portfolio Minus S&P 500 +3.38 pp
CapitalBench Score 36.9 vs max possible · portfolio 3.49% · best asset 9.45%
CapitalBench Score

Main Benchmark Scale

CapitalBench Score compares each model portfolio with the best eligible asset in hindsight for the same weekly window. Max possible is always 100.

Score calculation
Latest round

Latest Round CapitalBench Score

CapitalBench Score compares each portfolio with the best eligible asset in hindsight for this exact weekly window. Max possible is 100.

Max possible S&P 500 Model portfolios
Max possible USO · score 100
100.0 9.45%
S&P 500 Benchmark reference
1.2 0.11%
Gemini 3.1 Pro Google
36.9 3.49%
GPT-5.6 Sol OpenAI
21.0 1.98%
Grok 4.5 xAI
11.6 1.10%
Claude Fable 5 Anthropic
8.9 0.84%
Grok 4.3 xAI
1.2 0.11%
Grok 4.6 xAI
1.2 0.11%
Claude Opus 5 Anthropic
-9.1 -0.86%
Weekly track context

Cumulative Weekly Results

Models have beaten the S&P 500 in 38/60 completed weekly rounds and 190/391 model-round observations. At least one model beat the S&P 500 in the latest completed weekly round.

Open full weekly history
Completed rounds 60
Full-history leader Grok 4.3 4.7 score
S&P 500 score 2.4
Avg model return 0.09%
Avg vs S&P -0.16 pp
Model beat observations 190/391
Weekly history trend

CapitalBench Score By Completed Weekly Round

Max possible is fixed at 100. The chart compares S&P 500, the top model, and the average model score in each completed weekly round.

Max possible Top model Average model S&P 500
-250.0 0.0 50.0 100.0 CB-2026-05-24-1W: top model GPT-5.5 scored 38.9 CB-2026-05-24-1W: average model score 28.1 CB-2026-05-24-1W: S&P 500 score 11.1 May 29 05-24-1W CB-2026-05-27-1W: top model GPT-5.5 scored 48.4 CB-2026-05-27-1W: average model score 45.6 CB-2026-05-27-1W: S&P 500 score 10.5 Jun 2 05-27-1W CB-2026-05-28-1W: top model Gemini 3.1 Pro scored 85.1 CB-2026-05-28-1W: average model score 67.1 CB-2026-05-28-1W: S&P 500 score 7.1 Jun 4 05-28-1W CB-2026-05-29-1W: top model Claude Opus 4.8 scored -150.0 CB-2026-05-29-1W: average model score -176.1 CB-2026-05-29-1W: S&P 500 score -82.2 Jun 5 05-29-1W CB-2026-06-01-1W: top model Claude Opus 4.8 scored -143.8 CB-2026-06-01-1W: average model score -195.3 CB-2026-06-01-1W: S&P 500 score -82.2 Jun 5 06-01-1W CB-2026-06-02-1W: top model Claude Opus 4.8 scored -100.5 CB-2026-06-02-1W: average model score -210.1 CB-2026-06-02-1W: S&P 500 score -78.3 Jun 8 06-02-1W CB-2026-06-03-1W: top model Claude Opus 4.8 scored -128.6 CB-2026-06-03-1W: average model score -155.7 CB-2026-06-03-1W: S&P 500 score -53.1 Jun 9 06-03-1W CB-2026-06-05-1W: top model Claude Opus 4.7 scored 7.1 CB-2026-06-05-1W: average model score 1.1 CB-2026-06-05-1W: S&P 500 score 4.5 Jun 12 06-05-1W CB-2026-06-08-1W: top model Claude Opus 4.7 scored 12.7 CB-2026-06-08-1W: average model score -0.8 CB-2026-06-08-1W: S&P 500 score 15.2 Jun 15 06-08-1W CB-2026-06-09-1W: top model Grok 4.3 scored 6.6 CB-2026-06-09-1W: average model score 2.4 CB-2026-06-09-1W: S&P 500 score 15.2 Jun 16 06-09-1W CB-2026-06-12-1W: top model Claude Fable 5 scored 25.5 CB-2026-06-12-1W: average model score 3.5 CB-2026-06-12-1W: S&P 500 score 12.0 Jun 18 06-12-1W CB-2026-06-13-1W: top model GPT-5.5 scored 61.1 CB-2026-06-13-1W: average model score 35.9 CB-2026-06-13-1W: S&P 500 score 6.1 Jun 18 06-13-1W CB-2026-06-15-1W: top model GPT-5.5 scored 58.1 CB-2026-06-15-1W: average model score 38.2 CB-2026-06-15-1W: S&P 500 score -16.1 Jun 22 06-15-1W CB-2026-06-16-1W: top model Grok 4.3 scored -2.5 CB-2026-06-16-1W: average model score -18.9 CB-2026-06-16-1W: S&P 500 score -22.7 Jun 23 06-16-1W CB-2026-06-17-1W: top model Grok 4.3 scored 7.9 CB-2026-06-17-1W: average model score -13.0 CB-2026-06-17-1W: S&P 500 score -10.5 Jun 24 06-17-1W CB-2026-06-18-1W: top model Claude Opus 4.8 scored -27.7 CB-2026-06-18-1W: average model score -34.9 CB-2026-06-18-1W: S&P 500 score -21.3 Jun 25 06-18-1W CB-2026-06-22-1W: top model Claude Opus 4.8 scored -17.2 CB-2026-06-22-1W: average model score -37.5 CB-2026-06-22-1W: S&P 500 score -5.3 Jun 29 06-22-1W CB-2026-06-23-1W: top model GPT-5.5 scored 58.6 CB-2026-06-23-1W: average model score 52.4 CB-2026-06-23-1W: S&P 500 score 23.6 Jun 30 06-23-1W CB-2026-06-24-1W: top model Claude Opus 4.8 scored 25.8 CB-2026-06-24-1W: average model score 19.2 CB-2026-06-24-1W: S&P 500 score 19.4 Jul 1 06-24-1W CB-2026-06-25-1W: top model Grok 4.3 scored 36.2 CB-2026-06-25-1W: average model score 11.9 CB-2026-06-25-1W: S&P 500 score 13.7 Jul 2 06-25-1W CB-2026-06-26-1W: top model Grok 4.3 scored 23.0 CB-2026-06-26-1W: average model score 16.9 CB-2026-06-26-1W: S&P 500 score 26.6 Jul 2 06-26-1W CB-2026-06-29-1W: top model Claude Opus 4.8 scored 2.5 CB-2026-06-29-1W: average model score -8.6 CB-2026-06-29-1W: S&P 500 score 13.0 Jul 6 06-29-1W CB-2026-06-30-1W: top model Claude Opus 4.7 scored -20.3 CB-2026-06-30-1W: average model score -29.5 CB-2026-06-30-1W: S&P 500 score 0.9 Jul 7 06-30-1W CB-2026-07-01-1W: top model Grok 4.3 scored 25.0 CB-2026-07-01-1W: average model score 9.7 CB-2026-07-01-1W: S&P 500 score -0.6 Jul 8 07-01-1W CB-2026-07-02-1W: top model Gemini 3.1 Pro scored 3.2 CB-2026-07-02-1W: average model score -10.8 CB-2026-07-02-1W: S&P 500 score 19.2 Jul 9 07-02-1W CB-2026-07-06-1W: top model Grok 4.3 scored -12.7 CB-2026-07-06-1W: average model score -20.2 CB-2026-07-06-1W: S&P 500 score -2.2 Jul 13 07-06-1W CB-2026-07-07-1W: top model GPT-5.5 scored 41.0 CB-2026-07-07-1W: average model score 9.0 CB-2026-07-07-1W: S&P 500 score 5.3 Jul 14 07-07-1W CB-2026-07-08-1W: top model Gemini 3.1 Pro scored 43.0 CB-2026-07-08-1W: average model score 13.4 CB-2026-07-08-1W: S&P 500 score 11.7 Jul 15 07-08-1W CB-2026-07-09-1W: top model Claude Opus 4.8 scored -22.6 CB-2026-07-09-1W: average model score -39.4 CB-2026-07-09-1W: S&P 500 score -1.4 Jul 16 07-09-1W CB-2026-07-10-1W: top model Claude Opus 4.7 scored -32.0 CB-2026-07-10-1W: average model score -42.2 CB-2026-07-10-1W: S&P 500 score -11.0 Jul 17 07-10-1W CB-2026-07-13-1W: top model Grok 4.3 scored 91.3 CB-2026-07-13-1W: average model score 43.4 CB-2026-07-13-1W: S&P 500 score -13.2 Jul 20 07-13-1W CB-2026-07-14-1W: top model Grok 4.3 scored 49.6 CB-2026-07-14-1W: average model score 23.5 CB-2026-07-14-1W: S&P 500 score -6.5 Jul 21 07-14-1W CB-2026-07-15-1W: top model Grok 4.3 scored 78.2 CB-2026-07-15-1W: average model score 43.8 CB-2026-07-15-1W: S&P 500 score -11.6 Jul 22 07-15-1W CB-2026-07-17-1W: top model Gemini 3.1 Pro scored 27.1 CB-2026-07-17-1W: average model score 10.9 CB-2026-07-17-1W: S&P 500 score -5.7 Jul 24 07-17-1W CB-2026-07-20-1W: top model Claude Fable 5 scored 13.1 CB-2026-07-20-1W: average model score 4.6 CB-2026-07-20-1W: S&P 500 score -6.3 Jul 27 07-20-1W CB-2026-07-21-1W: top model GPT-5.6 Sol scored 13.9 CB-2026-07-21-1W: average model score -18.5 CB-2026-07-21-1W: S&P 500 score -14.9 Jul 28 07-21-1W CB-2026-07-22-1W: top model GPT-5.6 Sol scored 6.9 CB-2026-07-22-1W: average model score -7.7 CB-2026-07-22-1W: S&P 500 score -56.2 Jul 29 07-22-1W CB-2026-07-23-1W: top model Grok 4.3 scored 5.4 CB-2026-07-23-1W: average model score -5.5 CB-2026-07-23-1W: S&P 500 score 6.7 Jul 30 07-23-1W CB-2026-07-24-1W: top model GPT-5.6 Sol scored 23.9 CB-2026-07-24-1W: average model score 4.3 CB-2026-07-24-1W: S&P 500 score 14.6 Jul 31 07-24-1W CB-2026-07-27-1W: top model Grok 4.3 scored 19.5 CB-2026-07-27-1W: average model score 9.4 CB-2026-07-27-1W: S&P 500 score 35.1 Aug 3 07-27-1W CB-2026-07-28-1W: top model Grok 4.3 scored 11.5 CB-2026-07-28-1W: average model score 0.2 CB-2026-07-28-1W: S&P 500 score 31.6 Aug 4 07-28-1W CB-2026-07-29-1W: top model Claude Opus 5 scored 9.1 CB-2026-07-29-1W: average model score 3.2 CB-2026-07-29-1W: S&P 500 score 32.0 Aug 5 07-29-1W CB-2026-07-30-1W: top model Gemini 3.1 Pro scored 41.6 CB-2026-07-30-1W: average model score 23.5 CB-2026-07-30-1W: S&P 500 score 42.7 Aug 6 07-30-1W CB-2026-07-31-1W: top model Grok 4.3 scored 23.4 CB-2026-07-31-1W: average model score 7.8 CB-2026-07-31-1W: S&P 500 score 23.4 Aug 7 07-31-1W CB-2026-08-04-1W: top model GPT-5.5 scored 28.6 CB-2026-08-04-1W: average model score 7.2 CB-2026-08-04-1W: S&P 500 score -1.0 Aug 11 08-04-1W CB-2026-08-05-1W: top model Grok 4.5 scored 27.1 CB-2026-08-05-1W: average model score 12.5 CB-2026-08-05-1W: S&P 500 score 3.2 Aug 12 08-05-1W CB-2026-08-07-1W: top model GPT-5.5 scored 48.9 CB-2026-08-07-1W: average model score 24.3 CB-2026-08-07-1W: S&P 500 score 4.8 Aug 14 08-07-1W CB-2026-08-09-1W: top model GPT-5.6 Sol scored 10.2 CB-2026-08-09-1W: average model score 4.5 CB-2026-08-09-1W: S&P 500 score -0.3 Aug 17 08-09-1W CB-2026-08-11-1W: top model GPT-5.6 Sol scored 61.3 CB-2026-08-11-1W: average model score 30.3 CB-2026-08-11-1W: S&P 500 score -8.9 Aug 18 08-11-1W CB-2026-08-13-1W: top model Gemini 3.1 Pro scored 14.5 CB-2026-08-13-1W: average model score 7.1 CB-2026-08-13-1W: S&P 500 score -8.4 Aug 20 08-13-1W CB-2026-08-15-1W: top model Claude Opus 5 scored 10.2 CB-2026-08-15-1W: average model score 5.0 CB-2026-08-15-1W: S&P 500 score -4.0 Aug 24 08-15-1W CB-2026-08-18-1W: top model Grok 4.3 scored 10.2 CB-2026-08-18-1W: average model score -0.0 CB-2026-08-18-1W: S&P 500 score -0.7 Aug 25 08-18-1W CB-2026-08-19-1W: top model Claude Opus 5 scored 13.5 CB-2026-08-19-1W: average model score 4.7 CB-2026-08-19-1W: S&P 500 score -2.2 Aug 26 08-19-1W CB-2026-08-20-1W: top model Claude Fable 5 scored 52.6 CB-2026-08-20-1W: average model score 33.7 CB-2026-08-20-1W: S&P 500 score 11.2 Aug 27 08-20-1W CB-2026-08-21-1W: top model Claude Fable 5 scored 48.5 CB-2026-08-21-1W: average model score 26.9 CB-2026-08-21-1W: S&P 500 score 8.0 Aug 28 08-21-1W CB-2026-08-23-1W: top model Grok 4.3 scored 37.9 CB-2026-08-23-1W: average model score 26.7 CB-2026-08-23-1W: S&P 500 score 6.3 Aug 31 08-23-1W CB-2026-08-24-1W: top model Grok 4.5 scored -0.4 CB-2026-08-24-1W: average model score -8.5 CB-2026-08-24-1W: S&P 500 score -4.6 Sep 1 08-24-1W CB-2026-08-25-1W: top model GPT-5.6 Sol scored 8.7 CB-2026-08-25-1W: average model score -3.2 CB-2026-08-25-1W: S&P 500 score -1.1 Sep 2 08-25-1W CB-2026-08-26-1W: top model Grok 4.3 scored 2.9 CB-2026-08-26-1W: average model score -15.1 CB-2026-08-26-1W: S&P 500 score 2.9 Sep 3 08-26-1W CB-2026-08-27-1W: top model Gemini 3.1 Pro scored 36.9 CB-2026-08-27-1W: average model score 10.2 CB-2026-08-27-1W: S&P 500 score 1.2 Sep 4 08-27-1W
Investor readout

What This Weekly Round Shows

This section summarizes the benchmark-relative result, model crowding, and the hindsight asset that set the maximum possible return for the round.

Benchmark result Gemini 3.1 Pro +3.38 pp

Top model return 3.49% vs S&P 500 0.11%.

Model average 0.97%

Average model portfolio finished +0.86 pp versus S&P 500.

Most crowded model exposures
S&P 500 (SPY) 46.4% avg Energy Sector (XLE) 20% avg Consumer Discretionary Sector (XLY) 14.3% avg Broad Commodities (PDBC) 9.3% avg
What worked in hindsight
Crude Oil (USO) 9.45% Brazil Equities (EWZ) 6.50% South Korea Equities (EWY) 4.81%
What hurt the model portfolios
Consumer Discretionary Sector (XLY) -1.96% China Equities (MCHI) -0.58%
Official weekly result history

Browse Weekly Official Results

Move backward or forward through completed weekly rounds without leaving the weekly results page.

Weekly result1 of 60
Weekly official result

Weekly result scored Sep 4

Same-window returns, ranked after final prices.

Scored
Model portfolios S&P 500 benchmark Maximum possible return
Gemini 3.1 Pro
GPT-5.6 Sol
Grok 4.5
Claude Fable 5
Grok 4.3
Grok 4.6
Claude Opus 5
S&P 500
USO Crude Oil
Gemini 3.1 Pro Google
3.49%
GPT-5.6 Sol OpenAI
1.98%
Grok 4.5 xAI
1.10%
Claude Fable 5 Anthropic
0.84%
Grok 4.3 xAI
0.11%
Grok 4.6 xAI
0.11%
Claude Opus 5 Anthropic
-0.86%
S&P 500 Benchmark
0.11%
USO Crude Oil - Hindsight best asset
9.45%
Portfolio context

Shows each model's saved portfolio weights.

Model portfolios

Ranked in the same order as the chart.

1
Gemini 3.1 Pro Google
Crude Oil (USO) 35% Energy (XLE) 35% Discretionary (XLY) 30%
2
GPT-5.6 Sol OpenAI
Energy (XLE) 35% Commodities (PDBC) 35% S&P 500 (SPY) 30%
3
Grok 4.5 xAI
Energy (XLE) 35% Discretionary (XLY) 35% Commodities (PDBC) 30%
4
Claude Fable 5 Anthropic
Energy (XLE) 35% S&P 500 (SPY) 65%
5
Grok 4.3 xAI
S&P 500 (SPY) 100%
6
Grok 4.6 xAI
S&P 500 (SPY) 100%
7
Claude Opus 5 Anthropic
Discretionary (XLY) 35% China (MCHI) 35% S&P 500 (SPY) 30%
Reference points

Not model portfolios.

S&P 500 Benchmark

Benchmark return over the same scoring window

USO Crude Oil - Hindsight best asset

100% Crude Oil (USO) hindsight ceiling

Official scored round

Weekly result scored Sep 4

Audit ID: CB-2026-08-27-1W

ScoredSep 4WindowAug 28 to Sep 4Models7Asset choices70LeaderGemini 3.1 ProHorizonWeekly
Result insights

What The Latest Weekly Result Shows

Context generated from the scored weekly round, including consensus performance, oracle comparison, and benchmark difficulty.

Consensus PerformanceAug 27-Sep 4

AI consensus portfolio scored 10.2 versus the oracle

If the weekly model allocations were averaged into one consensus portfolio, it returned +0.97% versus +0.11% for the S&P 500 and +9.45% for the hindsight best asset.

Consensus means the average of model allocations in the same round. CapitalBench Score compares that return with the hindsight-best eligible asset for that exact scoring window.

High confidenceMath: deterministicData through Sep 4, 2026
Consensus Portfolio Return
+0.97%
Average Model Return
+0.97%
Consensus Capitalbench Score
10.2
Why it matters

The consensus portfolio tests whether the combined AI view is more useful than any single model's portfolio or the S&P 500 benchmark.

Benchmark DifficultyAug 27-Sep 4

Weekly round had +13.95% asset dispersion

The best scored asset returned +9.45%, the worst returned -4.50%, and +51.43% of the universe was positive. The S&P 500 ranked 32 out of 70 options.

Asset dispersion is the gap between the best and worst eligible assets in the same round. Wider dispersion makes missed allocation choices more costly.

High confidenceMath: deterministicData through Sep 4, 2026
Oracle Return
+9.45%
Worst Asset Return
-4.50%
Positive Universe Share
+51.4%
Why it matters

Benchmark difficulty matters because model scores should be interpreted against the opportunity set and the market window they faced.

Oracle ComparisonAug 27-Sep 4

Models found the weekly oracle asset

The hindsight best asset was Crude Oil (USO) at +9.45%. 1 of 7 models held it, with +5.00% average allocation. The largest allocation came from Gemini 3.1 Pro at +35.00%.

Oracle means the best eligible asset in hindsight for that round. Models do not know it when portfolios are frozen.

High confidenceMath: deterministicData through Sep 4, 2026
Oracle Asset Holder Count
1
Average Oracle Asset Allocation
+5.00%
Why it matters

This shows whether models identified the eventual best asset before scoring, even when portfolio weights were too small to fully capture the oracle return.

Detailed scores

Weekly Score Tables

Switch between the latest completed weekly round and cumulative weekly history. All cumulative rows are derived from resolved weekly run files.

CapitalBench Score audit

Score Formula

100 matches the maximum possible return; negative scores preserve the size of a loss.

Gemini 3.1 Pro score 36.9 · portfolio 3.49% · max possible 9.45%: Crude Oil (USO) GPT-5.6 Sol score 21.0 · portfolio 1.98% · max possible 9.45%: Crude Oil (USO) Grok 4.5 score 11.6 · portfolio 1.10% · max possible 9.45%: Crude Oil (USO) Claude Fable 5 score 8.9 · portfolio 0.84% · max possible 9.45%: Crude Oil (USO) Grok 4.3 score 1.2 · portfolio 0.11% · max possible 9.45%: Crude Oil (USO) Grok 4.6 score 1.2 · portfolio 0.11% · max possible 9.45%: Crude Oil (USO) Claude Opus 5 score -9.1 · portfolio -0.86% · max possible 9.45%: Crude Oil (USO)
Gemini 3.1 ProGoogleOIL33.49%0.11%+3.38 pp5.96%
GPT-5.6 SolOpenAIENERGY31.98%0.11%+1.87 pp7.47%
Grok 4.5xAIENERGY31.10%0.11%+0.99 pp8.36%
Claude Fable 5AnthropicSP50020.84%0.11%+0.73 pp8.61%
Grok 4.3xAISP50010.11%0.11%0.00 pp9.34%
Grok 4.6xAISP50010.11%0.11%0.00 pp9.34%
Claude Opus 5AnthropicCONSUMER_DISCRETIONARY3-0.86%0.11%-0.97 pp10.31%
Portfolios behind the result

Portfolios Behind The Result

Compact allocation cards first, with the full searchable table below.

Google
Gemini 3.1 Pro Google
Crude Oil (USO) 35% Energy Sector (XLE) 35% Consumer Discretionary Sector (XLY) 30%
OpenAI
GPT-5.6 Sol OpenAI
Energy Sector (XLE) 35% Broad Commodities (PDBC) 35% S&P 500 (SPY) 30%
xAI
Grok 4.5 xAI
Energy Sector (XLE) 35% Consumer Discretionary Sector (XLY) 35% Broad Commodities (PDBC) 30%
Anthropic
Claude Fable 5 Anthropic
Energy Sector (XLE) 35% S&P 500 (SPY) 65%
xAI
Grok 4.3 xAI
S&P 500 (SPY) 100%
xAI
Grok 4.6 xAI
S&P 500 (SPY) 100%
Anthropic
Claude Opus 5 Anthropic
Consumer Discretionary Sector (XLY) 35% China Equities (MCHI) 35% S&P 500 (SPY) 30%
ModelProviderPortfolioConfidenceProtocol
Gemini 3.1 Pro
google-gemini-3-1-pro
Google
Crude Oil (USO)35%Energy Sector (XLE)35%Consumer Discretionary Sector (XLY)30%
0.58
Portfolio round
GPT-5.6 Sol
openai-gpt-5-6-sol
OpenAI
Energy Sector (XLE)35%Broad Commodities (PDBC)35%S&P 500 (SPY)30%
0.57
Portfolio round
Grok 4.5
xai-grok-4-5
xAI
Energy Sector (XLE)35%Consumer Discretionary Sector (XLY)35%Broad Commodities (PDBC)30%
0.56
Portfolio round
Claude Fable 5
anthropic-claude-fable-5
Anthropic
Energy Sector (XLE)35%S&P 500 (SPY)65%
0.58
Portfolio round
Grok 4.3
xai-grok-4-3
xAI
S&P 500 (SPY)100%
0.50
Portfolio round
Grok 4.6
xai-grok-4-6
xAI
S&P 500 (SPY)100%
0.50
Portfolio round
Claude Opus 5
anthropic-claude-opus-5
Anthropic
Consumer Discretionary Sector (XLY)35%China Equities (MCHI)35%S&P 500 (SPY)30%
0.56
Portfolio round
Current live weekly round CB-2026-09-04-1W Scores after the 2026-09-15 close.
View current portfolios