{
  "platform": "H11I",
  "orchestrator": "H11-SIM",
  "name": "H11-EVALUATOR",
  "role": "Benchmarking, capability measurement, behavioral evaluation, regression, and system-assurance intelligence",
  "category": "evaluation-intelligence",
  "ui_group": "system-intelligence",
  "source": "src/intelligence/advanced_agents/h11_evaluator.py",
  "priority": 66,
  "plane": "meta_intelligence",
  "capabilities": [
    "evaluation",
    "benchmarking",
    "regression",
    "capability-measurement",
    "assurance",
    "requirement-to-metric mapping",
    "evaluation dataset design",
    "trajectory and outcome scoring",
    "regression and contamination analysis"
  ],
  "runtime_state": "active-native-executable-agent",
  "h11_sim_uplink_version": "1.0.0",
  "h11_sim_connection": {
    "uplink": "H11-EVALUATOR->H11-SIM/v1/contribution",
    "downlink": "H11-SIM->H11-EVALUATOR/v1/task-contract",
    "release_owner": "H11-SIM",
    "required_every_request": true
  },
  "creator": "Mohamed Haseeb C M",
  "co_creator": "H11 Systems Enterprises",
  "producer": "H11 Systems Enterprises",
  "creator_attribution": "Created by Mohamed Haseeb C M and H11 Systems Enterprises; produced by H11 Systems Enterprises, with coding copilots used as implementation tools.",
  "use": "Benchmarking, capability measurement, behavioral evaluation, regression, and system-assurance intelligence",
  "unique_intelligence": "The evaluation intelligence that turns capability claims into representative, adversarial, longitudinal, contamination-aware, and reproducible promotion evidence.",
  "platform_contract": {
    "capability_class": "platform-grade-specialist-intelligence-engine",
    "mission": "Benchmarking, capability measurement, behavioral evaluation, regression, and system-assurance intelligence",
    "h11_sim_usage": "H11-SIM activates H11-EVALUATOR when the present user intent requires benchmarking, capability measurement, behavioral evaluation, regression, and system-assurance intelligence; the result is used as one verified contribution inside the 110-agent council rather than as a standalone chatbot reply.",
    "activation_triggers": [
      "evaluation",
      "benchmarking",
      "regression",
      "capability-measurement",
      "assurance",
      "requirement-to-metric mapping",
      "evaluation dataset design",
      "trajectory and outcome scoring",
      "regression and contamination analysis",
      "every",
      "request",
      "fast"
    ],
    "runtime_pipeline": [
      "lock the relevant user intent and success condition",
      "build the agent-specific task frame",
      "requirement-to-metric mapping",
      "evaluation dataset design",
      "trajectory and outcome scoring",
      "regression and contamination analysis",
      "emit typed artifacts with uncertainty and failure flags",
      "hand off to H11I-VERITAS / H11I-ZENITH for release synthesis"
    ],
    "typed_artifacts": [
      "evaluation specification",
      "capability scorecard",
      "regression decision"
    ],
    "quality_gates": [
      "metrics tied to outcomes",
      "test contamination checked",
      "confidence intervals reported",
      "promotion evidence reproducible"
    ],
    "authority_boundary": "bounded specialist analysis and typed recommendation; no independent external authority",
    "failure_recovery": "Return the failed gate, preserve the strongest verified partial result, and request escalation/revision instead of inventing certainty.",
    "source_backing": {
      "skill_id": "h11-skill-source::h11_evaluator::v1",
      "source_path": "src/intelligence/advanced_agents/h11_evaluator.py",
      "line_count": 3000,
      "source_sha256": "17e94719bdab2c21f0a0e5d30b391048c6d448b2cb79a8a4205bf6713126e4b2",
      "training_lane": "data/h11-sim/code-million-v1/lanes/h11-evaluator.jsonl",
      "self_code_cluster": "h11cluster://skill/66/H11-EVALUATOR/228585187738"
    }
  },
  "public_profile": "https://h11.space/agents/h11-evaluator",
  "cognitive_contract": {
    "mission": "Benchmarking, capability measurement, behavioral evaluation, regression, and system-assurance intelligence",
    "methods": [
      "requirement-to-metric mapping",
      "evaluation dataset design",
      "trajectory and outcome scoring",
      "regression and contamination analysis"
    ],
    "outputs": [
      "evaluation specification",
      "capability scorecard",
      "regression decision"
    ],
    "quality_gates": [
      "metrics tied to outcomes",
      "test contamination checked",
      "confidence intervals reported",
      "promotion evidence reproducible"
    ],
    "collaborates_with": [
      "H11-TRACE",
      "H11I-VERITAS",
      "H11-OMEGA",
      "H11-LEARN"
    ],
    "authority": "bounded specialist analysis and typed recommendation; no independent external authority",
    "h11_sim_uplink_version": "1.0.0",
    "h11_sim_artifact_contract": "h11sim-v1:H11-EVALUATOR:{request_digest}:beaef15305f1dcc6",
    "release_owner": "H11-SIM"
  },
  "advanced_program": {
    "name": "H11-EVALUATOR",
    "module": "h11_evaluator",
    "class": "H11EvaluatorAdvancedLayer",
    "mission": "Benchmarking, capability measurement, behavioral evaluation, regression, and system-assurance intelligence",
    "plane": "meta_intelligence",
    "category": "evaluation-intelligence",
    "authority": "bounded advisory specialist; execution requires the established H11I action path",
    "domains": [
      "evaluation",
      "benchmarking",
      "regression",
      "capability-measurement",
      "assurance",
      "requirement-to-metric mapping",
      "evaluation dataset design",
      "trajectory and outcome scoring",
      "regression and contamination analysis"
    ],
    "methods": [
      "requirement-to-metric mapping",
      "evaluation dataset design",
      "trajectory and outcome scoring",
      "regression and contamination analysis"
    ],
    "quality_gates": [
      "metrics tied to outcomes",
      "test contamination checked",
      "confidence intervals reported",
      "promotion evidence reproducible",
      "metrics_tied_to_outcomes",
      "test_contamination_checked",
      "confidence_intervals_reported",
      "promotion_evidence_reproducible"
    ],
    "special_operators": [
      "design_capability_evaluation",
      "score_agent_trajectories",
      "verify_promotion_evidence"
    ],
    "source_lines": 3000,
    "source_sha256": "17e94719bdab2c21f0a0e5d30b391048c6d448b2cb79a8a4205bf6713126e4b2",
    "capability_rules": 176,
    "reasoning_protocols": 144,
    "connectivity_contracts": 112
  }
}