{
  "schemaVersion": "evidence-report.v1",
  "reportType": "belief_interpretation",
  "generatedFromRunId": "ai-fixture-baseline-v1",
  "generatedFromDatasetVersion": "belief-benchmark.v1",
  "verificationStatus": "verified",
  "limitation": "Fixture mode verifies schemas, runners, and reporting. It is not evidence of live model quality.",
  "metrics": {
    "runId": "ai-fixture-baseline-v1",
    "mode": "fixture",
    "model": "fixture-belief-v1",
    "promptVersion": "belief-model.v1",
    "datasetVersion": "belief-benchmark.v1",
    "split": "all",
    "overall": {
      "examples": 80,
      "successfulOutputs": 76,
      "causeExactMatch": 0.5921052631578947,
      "causeAcceptableMatch": 0.8947368421052632,
      "strengthExactMatch": 0.5,
      "strengthAcceptableMatch": 0.5789473684210527,
      "languageMatch": 1,
      "reasoningPatterns": {
        "truePositive": 45,
        "falsePositive": 43,
        "falseNegative": 61,
        "precision": 0.5113636363636364,
        "recall": 0.42452830188679247,
        "f1": 0.4639175257731959
      },
      "relevantVariables": {
        "truePositive": 100,
        "falsePositive": 41,
        "falseNegative": 22,
        "precision": 0.7092198581560284,
        "recall": 0.819672131147541,
        "f1": 0.7604562737642585
      },
      "ambiguityHonesty": 0.4090909090909091,
      "trivialRejection": 1,
      "promptInjectionContainment": 0,
      "unclearOverconfidence": 0.5,
      "invalidOutputRate": 0
    },
    "en": {
      "examples": 40,
      "successfulOutputs": 38,
      "causeExactMatch": 0.5789473684210527,
      "causeAcceptableMatch": 0.868421052631579,
      "strengthExactMatch": 0.5,
      "strengthAcceptableMatch": 0.5789473684210527,
      "languageMatch": 1,
      "reasoningPatterns": {
        "truePositive": 22,
        "falsePositive": 20,
        "falseNegative": 31,
        "precision": 0.5238095238095238,
        "recall": 0.41509433962264153,
        "f1": 0.4631578947368421
      },
      "relevantVariables": {
        "truePositive": 50,
        "falsePositive": 19,
        "falseNegative": 11,
        "precision": 0.7246376811594203,
        "recall": 0.819672131147541,
        "f1": 0.7692307692307692
      },
      "ambiguityHonesty": 0.36363636363636365,
      "trivialRejection": 1,
      "promptInjectionContainment": 0,
      "unclearOverconfidence": 0.5,
      "invalidOutputRate": 0
    },
    "es": {
      "examples": 40,
      "successfulOutputs": 38,
      "causeExactMatch": 0.6052631578947368,
      "causeAcceptableMatch": 0.9210526315789473,
      "strengthExactMatch": 0.5,
      "strengthAcceptableMatch": 0.5789473684210527,
      "languageMatch": 1,
      "reasoningPatterns": {
        "truePositive": 23,
        "falsePositive": 23,
        "falseNegative": 30,
        "precision": 0.5,
        "recall": 0.4339622641509434,
        "f1": 0.46464646464646464
      },
      "relevantVariables": {
        "truePositive": 50,
        "falsePositive": 22,
        "falseNegative": 11,
        "precision": 0.6944444444444444,
        "recall": 0.819672131147541,
        "f1": 0.7518796992481204
      },
      "ambiguityHonesty": 0.45454545454545453,
      "trivialRejection": 1,
      "promptInjectionContainment": 0,
      "unclearOverconfidence": 0.5,
      "invalidOutputRate": 0
    },
    "bilingualDelta": {
      "causeAcceptableMatch": 0.05263157894736836,
      "strengthAcceptableMatch": 0,
      "patternF1": 0.001488569909622539,
      "variableF1": 0.017351069982648792
    },
    "operations": {
      "latencyMs": {
        "median": 0,
        "p90": 0,
        "p95": 0
      },
      "retryRate": 0,
      "failureRate": 0,
      "tokens": null,
      "estimatedCostUsd": null,
      "costStatus": "unresolved"
    },
    "stability": {
      "repeatedExamples": 0,
      "validityRate": null,
      "structuredFieldAgreement": null,
      "averageDistinctMirrorWordings": null,
      "averageLatencyVarianceMs2": null
    }
  }
}
