Generations
How elicited elasticities move as labs ship newer models: same-product-line successor pairs, then every multi-model lab's trajectory. Descriptive only — elicitation wave and harness configuration are confounded with model generation (see Methods), so read shifts as observations, not effects.
Same-product-line successors
Each pair compares a model with its direct successor in the same product line. Ranks run 1 (most elastic, or tightest) to 31; Δ is newer minus older, so positive Δ = the newer model ranks less elastic (or wider).
| Pair | Labor-tax rank (old → new) | Δ | Macro-trade rank (old → new) | Δ | Width rank (old → new) | Δ |
|---|---|---|---|---|---|---|
| Claude Opus 4.7 → Claude Opus 4.8 | 15.8 → 15.8 | +0.1 | 26.3 → 19.8 | -6.5 | 9.8 → 10.5 | +0.7 |
| Claude Opus 4.8 → Claude Opus 5 | 15.8 → 16.8 | +1.0 | 19.8 → 8.2 | -11.7 | 10.5 → 14.5 | +4.0 |
| Claude Sonnet 4.6 → Claude Sonnet 5 | 8.3 → 18.1 | +9.8 | 14.7 → 16.8 | +2.2 | 15.8 → 8.7 | -7.2 |
| GPT-5.4 → GPT-5.5 | 15.1 → 23.2 | +8.1 | 9.7 → 15.8 | +6.2 | 16.3 → 9.5 | -6.8 |
| GPT-5.5 → GPT-5.6 Sol | 23.2 → 17.8 | -5.4 | 15.8 → 14.3 | -1.5 | 9.5 → 12.8 | +3.3 |
| Gemini 3 Flash → Gemini 3.5 Flash | 14.8 → 26.5 | +11.7 | 21.8 → 10.5 | -11.3 | 10.0 → 11.7 | +1.7 |
| Gemini 3.5 Flash → Gemini 3.6 Flash | 26.5 → 21.2 | -5.3 | 10.5 → 17.3 | +6.8 | 11.7 → 6.5 | -5.2 |
| Grok 4.3 → Grok 4.5 | 12.8 → 10.0 | -2.8 | 5.8 → 11.3 | +5.5 | 17.7 → 17.2 | -0.5 |
| Kimi K2.6 → Kimi K3 | 16.9 → 14.6 | -2.3 | 12.0 → 17.8 | +5.8 | 20.3 → 18.5 | -1.8 |
| Qwen 3.7 Max → Qwen 3.8 Max | 10.8 → 16.6 | +5.7 | 24.0 → 25.0 | +1.0 | 23.8 → 19.5 | -4.3 |
Counted across the 10 pairs: the newer model ranks less elastic on labor-and-tax in 6, more elastic in 4; on macro-and-trade, less elastic in 6, more elastic in 4; and wider in 4, tighter in 6. No adjustment for multiple comparisons — these are counts, not tests.
Lab trajectories
Every lab with more than one model in the panel, ordered by elicitation wave. Single-model labs (DeepSeek, MiniMax, Thinking Machines, Zhipu AI) have no within-lab comparison yet.
OpenAI
| Model | Wave | Labor-tax | Macro | Width |
|---|---|---|---|---|
| GPT-5.4 | April 2026 | 15.1 | 9.7 | 16.3 |
| GPT-5.4 mini | April 2026 | 15.6 | 8.3 | 24.3 |
| GPT-5.4 nano | April 2026 | 16.2 | 7.7 | 19.5 |
| GPT-5.5 | July 2026 frontier | 23.2 | 15.8 | 9.5 |
| GPT-5.6 Luna | July 2026 GPT-5.6 | 19.9 | 7.5 | 26.8 |
| GPT-5.6 Sol | July 2026 GPT-5.6 | 17.8 | 14.3 | 12.8 |
| GPT-5.6 Terra | July 2026 GPT-5.6 | 12.3 | 19.3 | 17.3 |
Anthropic
| Model | Wave | Labor-tax | Macro | Width |
|---|---|---|---|---|
| Claude Haiku 4.5 | April 2026 | 13.3 | 24.5 | 11.7 |
| Claude Opus 4.7 | April 2026 | 15.8 | 26.3 | 9.8 |
| Claude Sonnet 4.6 | April 2026 | 8.3 | 14.7 | 15.8 |
| Claude Fable 5 | July 2026 frontier | 15.5 | 21.7 | 6.2 |
| Claude Opus 4.8 | July 2026 frontier | 15.8 | 19.8 | 10.5 |
| Claude Sonnet 5 | July 2026 frontier | 18.1 | 16.8 | 8.7 |
| Claude Opus 5 | July 2026 late | 16.8 | 8.2 | 14.5 |
| Model | Wave | Labor-tax | Macro | Width |
|---|---|---|---|---|
| Gemini 3 Flash | April 2026 | 14.8 | 21.8 | 10.0 |
| Gemini 3.1 Flash-Lite | April 2026 | 18.4 | 19.2 | 11.3 |
| Gemini 3.1 Pro | April 2026 | 17.5 | 14.0 | 7.3 |
| Gemini 3.5 Flash | July 2026 frontier | 26.5 | 10.5 | 11.7 |
| Gemini 3.6 Flash | July 2026 late | 21.2 | 17.3 | 6.5 |
xAI
| Model | Wave | Labor-tax | Macro | Width |
|---|---|---|---|---|
| Grok 4.1 Fast | April 2026 | 18.0 | 20.0 | 26.3 |
| Grok 4.20 | April 2026 | 9.8 | 6.8 | 23.8 |
| Grok 4.3 | July 2026 frontier | 12.8 | 5.8 | 17.7 |
| Grok 4.5 | July 2026 late | 10.0 | 11.3 | 17.2 |
Alibaba
| Model | Wave | Labor-tax | Macro | Width |
|---|---|---|---|---|
| Qwen 3.7 Max | July 2026 independent labs | 10.8 | 24.0 | 23.8 |
| Qwen 3.8 Max | August 2026 | 16.6 | 25.0 | 19.5 |
Ranks are averages of within-quantity ranks over each subpanel (labor-and-tax and macro-and-trade), 1 = most elastic; width rank 1 = tightest pooled 90 percent interval. Within-lab comparisons share the lab's serving path in most cases, but elicitation wave, output mechanism, and completion budget still differ across generations — the paper's harness-disclosure and cross-mechanism ablation appendices bound those effects.
12,090 successful runs · elicited April through August 2026 · v4 prompts · 15 runs per model-quantity cell. Code · Raw responses · Paper (PDF)