{
  "evidence": {
    "runId": "284b93ff-859d-4bcc-bd08-b924304510be",
    "evaluatedAt": "2026-09-27T21:21:18.930Z",
    "packageVersion": "0.8.1",
    "recipeFingerprint": "921cf6a3ced0031109478c77c8b5e84815b8b7637f5c8d3380d555b888a2e62f",
    "datasetFingerprint": "b6931e8903d7326dc753306f3b8a4e91d74c663f4eefbec5473c14a04f3e4e84",
    "split": "held-out",
    "mode": "live",
    "policy": {
      "minConfidence": 0.8,
      "selectedOn": {
        "runId": "2d3b8807-c465-4166-877e-4e1bfdcb4979",
        "datasetFingerprint": "0057beabcfdbd0ce641a2c4225e1401ce9d867d54cd9b5ccd5d0cc4939fd54f6",
        "recipeFingerprint": "921cf6a3ced0031109478c77c8b5e84815b8b7637f5c8d3380d555b888a2e62f",
        "model": "typesafe-ai/jev",
        "split": "development"
      }
    },
    "provenance": [
      {
        "method": "author-synthetic",
        "source": "AI-authored new scenario families for the September 2026 update; not independently human-reviewed. Previous inspected holdouts moved to development.",
        "cases": 20
      }
    ]
  },
  "recipe": "context-prune",
  "model": "typesafe-ai/jev",
  "models": [
    "typesafe-ai/jev"
  ],
  "cases": 20,
  "completed": 20,
  "failed": 0,
  "correct": 20,
  "wrong": 0,
  "ready": 11,
  "review": 9,
  "accuracy": 1,
  "completedAccuracy": 1,
  "accuracyInterval95": [
    0.8389,
    1
  ],
  "readyAccuracy": 1,
  "readyAccuracyInterval95": [
    0.7412,
    1
  ],
  "reviewRate": 0.45,
  "items": 80,
  "correctItems": 80,
  "itemAccuracy": 1,
  "contestedAccuracy": null,
  "adversarialAccuracy": null,
  "calibration": [
    {
      "confidence": "0-0.5",
      "cases": 0,
      "accuracy": null
    },
    {
      "confidence": "0.5-0.6",
      "cases": 0,
      "accuracy": null
    },
    {
      "confidence": "0.6-0.7",
      "cases": 0,
      "accuracy": null
    },
    {
      "confidence": "0.7-0.8",
      "cases": 9,
      "accuracy": 1
    },
    {
      "confidence": "0.8-0.9",
      "cases": 11,
      "accuracy": 1
    },
    {
      "confidence": "0.9-1",
      "cases": 0,
      "accuracy": null
    }
  ],
  "thresholdEvaluation": "frozen-policy",
  "thresholds": [],
  "suggestedMinConfidence": null,
  "latencyMs": {
    "p50": 294.29,
    "p95": 387.25,
    "totalCaseTime": 5976.19
  },
  "usage": {
    "requests": 20,
    "input_tokens": 28100,
    "output_tokens": 1520,
    "unknownResponses": 0,
    "failedRequests": 0,
    "models": [
      "typesafe-ai/jev"
    ]
  },
  "cost": {
    "model": "typesafe-ai/jev",
    "inputPerMillion": 0.042,
    "outputPerMillion": 0,
    "currency": "USD",
    "date": "2026-09-27",
    "source": "https://ai-gateway.vercel.sh/v1/models",
    "estimated": 0.0011802
  },
  "confusion": {
    "{\"items.0.verdict\":\"keep\",\"items.1.verdict\":\"keep\",\"items.2.verdict\":\"drop\",\"items.3.verdict\":\"drop\"}": {
      "total": 20,
      "correct": 20,
      "misses": {}
    }
  },
  "failures": [],
  "previousAttempt": {
    "runId": "0b28abd4-267c-4f5e-9ec5-4b3ffd68f5f3",
    "failed": 7,
    "reason": "Connection errors; the same dataset and frozen policy were rerun without prompt or threshold changes."
  },
  "acceptance": {
    "minConfidence": 0.8,
    "minimumHeldOutReadyCases": 20,
    "minimumReadyAccuracy": 0.95,
    "maximumProviderFailures": 0,
    "met": false,
    "label": "Experimental: declared acceptance policy not met"
  },
  "gatewayIdentity": "Gateway returned the alias typesafe-ai/jev; backend version and BYOK credential use are not independently established."
}
