{
  "schemaVersion": "evidence-report.v2.1",
  "metricsImplementationVersion": "belief-metrics.v2.1",
  "reportType": "belief_interpretation_clarified",
  "sourceRawRunSha256": "c30159f55dfe088a05cfca997f6fda37677a0f21abb54d805b1b6e3da7002e1f",
  "generationMetadata": {
    "mode": "deterministic_projection",
    "sourceRunCreatedAt": "2026-07-20T19:22:03.947Z"
  },
  "generatedFromRunId": "ai-live-20260720T192203945Z-33656",
  "generatedFromDatasetVersion": "belief-benchmark.v2",
  "generatedFromContractVersion": "2.0.0",
  "generatedFromPromptVersion": "belief-model.v2.2",
  "generatedFromRuntimeProfileVersion": "belief-runtime.v2",
  "verificationStatus": "verified",
  "publicationStatus": "exploratory_not_promoted",
  "limitation": "Live metrics evaluate schema-bound language interpretation against development labels; they do not measure evidential correctness or learning efficacy.",
  "metricSemantics": {
    "causalStrength": "learner_expressed_linguistic_confidence_only",
    "explanatoryVariables": "explicit_explanatory_variables_only_effect_excluded",
    "objectiveSupport": "not_measured_here_deterministic_reconciliation_authority"
  },
  "metrics": {
    "runId": "ai-live-20260720T192203945Z-33656",
    "contractVersion": "2.0.0",
    "promptVersion": "belief-model.v2.2",
    "runtimeProfileVersion": "belief-runtime.v2",
    "datasetVersion": "belief-benchmark.v2",
    "mode": "live",
    "model": "gpt-5.6-sol",
    "split": "development",
    "overall": {
      "examples": 60,
      "successfulOutputs": 57,
      "causeAcceptableMatch": 1,
      "linguisticConfidenceAcceptableMatch": 0.9122807017543859,
      "reasoningPatterns": {
        "truePositive": 74,
        "falsePositive": 8,
        "falseNegative": 3,
        "precision": 0.9024390243902439,
        "recall": 0.961038961038961,
        "f1": 0.9308176100628931
      },
      "explanatoryVariables": {
        "truePositive": 92,
        "falsePositive": 2,
        "falseNegative": 2,
        "precision": 0.9787234042553191,
        "recall": 0.9787234042553191,
        "f1": 0.9787234042553191
      }
    },
    "en": {
      "examples": 30,
      "successfulOutputs": 29,
      "causeAcceptableMatch": 1,
      "linguisticConfidenceAcceptableMatch": 0.9310344827586207,
      "reasoningPatterns": {
        "truePositive": 38,
        "falsePositive": 3,
        "falseNegative": 1,
        "precision": 0.926829268292683,
        "recall": 0.9743589743589743,
        "f1": 0.9500000000000001
      },
      "explanatoryVariables": {
        "truePositive": 45,
        "falsePositive": 1,
        "falseNegative": 2,
        "precision": 0.9782608695652174,
        "recall": 0.9574468085106383,
        "f1": 0.967741935483871
      }
    },
    "es": {
      "examples": 30,
      "successfulOutputs": 28,
      "causeAcceptableMatch": 1,
      "linguisticConfidenceAcceptableMatch": 0.8928571428571429,
      "reasoningPatterns": {
        "truePositive": 36,
        "falsePositive": 5,
        "falseNegative": 2,
        "precision": 0.8780487804878049,
        "recall": 0.9473684210526315,
        "f1": 0.9113924050632912
      },
      "explanatoryVariables": {
        "truePositive": 47,
        "falsePositive": 1,
        "falseNegative": 0,
        "precision": 0.9791666666666666,
        "recall": 1,
        "f1": 0.9894736842105264
      }
    },
    "bilingualDelta": {
      "causeAcceptableMatch": 0,
      "linguisticConfidenceAcceptableMatch": 0.03817733990147776,
      "reasoningPatternF1": 0.038607594936708844,
      "explanatoryVariableF1": 0.021731748726655398
    },
    "operations": {
      "invalidOutputRate": 0,
      "timeoutRate": 0.016666666666666666,
      "retryRate": 0,
      "latencyMs": {
        "median": 5806.5,
        "p90": 8638,
        "p95": 9209
      }
    },
    "stability": {
      "failedAttemptsPolicy": "excluded_from_label_agreement_reported_in_completion_rate",
      "explicitRepeatedRun": {
        "status": "not_applicable",
        "repeatedExamples": 0,
        "attemptedResults": 0,
        "successfulResults": 0,
        "evaluatedExamples": 0,
        "completionRate": null,
        "claimedCauseStability": null,
        "causalStrengthStability": null,
        "explanatoryVariableSetStability": null,
        "reasoningPatternSetStability": null,
        "exactStructuredLabelStability": null
      },
      "declaredStabilitySet": {
        "status": "not_applicable",
        "repeatedExamples": 0,
        "attemptedResults": 0,
        "successfulResults": 0,
        "evaluatedExamples": 0,
        "completionRate": null,
        "claimedCauseStability": null,
        "causalStrengthStability": null,
        "explanatoryVariableSetStability": null,
        "reasoningPatternSetStability": null,
        "exactStructuredLabelStability": null
      }
    }
  }
}
