name: ci-health-monitoring
title: Continuous CI/CD Health Monitoring and Optimization
description: Proactive monitoring and optimization workflow for maintaining high-performance GitLab CI/CD pipelines with cross-pack integration intelligence

agents:
  - glab
  - dev
  - pm

metadata:
  estimated_duration: "Ongoing (30-60 minutes per review cycle)"
  complexity: "low-medium"
  frequency: "Daily monitoring, weekly deep analysis"
  prerequisites:
    - Functional GitLab CI/CD pipeline
    - GitLab CLI authenticated
    - Historical pipeline data available
  success_metrics:
    - Pipeline health score > 80%
    - Mean time to detection < 15 minutes
    - False positive rate < 5%
    - Performance trend improvements

phases:
  health_assessment:
    title: "Pipeline Health Assessment"
    description: "Comprehensive health check of CI/CD pipelines across all monitored branches"
    estimated_duration: "15-30 minutes"
    frequency: "Daily"
    agents: ["glab"]
    tasks:
      - monitor-pipeline-status
      - generate-ci-health-report
    decision_points:
      - health_threshold_evaluation:
          question: "Is overall pipeline health above acceptable threshold (80%)?"
          options:
            healthy: "Continue with standard monitoring"
            degraded: "Initiate performance investigation"
            critical: "Trigger immediate remediation workflow"
    success_criteria:
      - Health metrics collected for all monitored branches
      - Performance baselines established
      - Health trends identified
      - Alert thresholds evaluated
    outputs:
      - health_assessment_report
      - performance_metrics
      - trend_analysis
      - alert_recommendations

  integration_health_check:
    title: "Cross-Pack Integration Health Check"
    description: "Monitor and validate health of integrations with JIRA, parallel development, and other expansion packs"
    estimated_duration: "10-20 minutes"
    frequency: "Daily"
    dependencies: ["health_assessment"]
    agents: ["glab", "pm"]
    tasks:
      - coordinate-parallel-ci
      - sync-ci-status-to-jira
    decision_points:
      - integration_status_review:
          question: "Are all integration points functioning correctly?"
          options:
            all_healthy: "Continue monitoring"
            partial_issues: "Schedule integration maintenance"
            major_issues: "Initiate integration debugging workflow"
    success_criteria:
      - JIRA integration status validated
      - Parallel development coordination confirmed
      - Cross-pack communication verified
      - Integration performance measured
    outputs:
      - integration_health_summary
      - sync_status_report
      - coordination_metrics

  performance_analysis:
    title: "Performance Trend Analysis"
    description: "Deep analysis of pipeline performance trends and identification of optimization opportunities"
    estimated_duration: "30-45 minutes"
    frequency: "Weekly"
    dependencies: ["health_assessment"]
    agents: ["glab", "dev"]
    tasks:
      - generate-ci-health-report
      - analyze-pipeline-failures
    decision_points:
      - performance_trend_evaluation:
          question: "Are performance trends showing improvement, stability, or degradation?"
          options:
            improving: "Document successful optimizations"
            stable: "Continue current monitoring approach"
            degrading: "Initiate performance optimization workflow"
    success_criteria:
      - Performance trends analyzed
      - Bottlenecks identified
      - Optimization opportunities documented
      - Historical comparison completed
    outputs:
      - performance_trend_report
      - optimization_recommendations
      - bottleneck_analysis

  proactive_optimization:
    title: "Proactive Performance Optimization"
    description: "Implement identified optimizations and performance improvements before issues become critical"
    estimated_duration: "1-3 hours"
    frequency: "Bi-weekly or as needed"
    dependencies: ["performance_analysis"]
    agents: ["dev", "glab"]
    tasks:
      - debug-ci-configuration
      - create-gitlab-workflow-plan
    decision_points:
      - optimization_priority:
          question: "What is the priority level for identified optimizations?"
          options:
            high_impact: "Implement immediately"
            medium_impact: "Schedule for next maintenance window"
            low_impact: "Add to backlog for future consideration"
    success_criteria:
      - High-priority optimizations implemented
      - Performance improvements measured
      - Configuration changes validated
      - No regressions introduced
    outputs:
      - optimization_implementation_results
      - performance_improvement_metrics
      - updated_configurations

  stakeholder_reporting:
    title: "Stakeholder Communication and Reporting"
    description: "Generate and distribute health reports to stakeholders with actionable insights"
    estimated_duration: "20-30 minutes"
    frequency: "Weekly"
    dependencies: ["performance_analysis", "integration_health_check"]
    agents: ["pm", "glab"]
    tasks:
      - generate-ci-health-report
      - sync-ci-status-to-jira
    decision_points:
      - reporting_detail_level:
          question: "What level of detail is appropriate for stakeholder reports?"
          options:
            executive_summary: "High-level metrics and trends only"
            detailed_analysis: "Comprehensive technical details"
            custom_format: "Tailored report based on audience needs"
    success_criteria:
      - Stakeholder reports generated
      - Key metrics communicated clearly
      - Action items identified
      - Feedback collection initiated
    outputs:
      - stakeholder_health_report
      - executive_summary
      - action_item_list

  continuous_improvement:
    title: "Continuous Improvement Planning"
    description: "Analyze monitoring effectiveness and plan improvements to the monitoring process itself"
    estimated_duration: "45-60 minutes"
    frequency: "Monthly"
    dependencies: ["stakeholder_reporting"]
    agents: ["pm", "dev", "glab"]
    tasks:
      - create-gitlab-workflow-plan
      - generate-ci-health-report
    decision_points:
      - improvement_focus_area:
          question: "Which area of CI/CD monitoring needs the most improvement?"
          options:
            detection_speed: "Focus on faster issue detection"
            accuracy: "Improve monitoring accuracy and reduce false positives"
            integration: "Enhance cross-pack integration monitoring"
            automation: "Increase automation of monitoring processes"
    success_criteria:
      - Monitoring effectiveness evaluated
      - Improvement opportunities identified
      - Enhancement plan created
      - Success metrics updated
    outputs:
      - monitoring_improvement_plan
      - enhanced_metrics_definition
      - process_optimization_recommendations

checkpoints:
  - phase: health_assessment
    checkpoint: baseline_established
    validation: "Current health baseline documented with key metrics"
    frequency: "Daily"
  - phase: integration_health_check
    checkpoint: integration_status_confirmed
    validation: "All integration points validated and functioning"
    frequency: "Daily"
  - phase: performance_analysis
    checkpoint: trends_analyzed
    validation: "Performance trends analyzed and documented"
    frequency: "Weekly"
  - phase: proactive_optimization
    checkpoint: optimizations_applied
    validation: "Identified optimizations successfully implemented"
    frequency: "As needed"
  - phase: stakeholder_reporting
    checkpoint: reports_distributed
    validation: "Health reports generated and distributed to stakeholders"
    frequency: "Weekly"
  - phase: continuous_improvement
    checkpoint: improvements_planned
    validation: "Monitoring improvement plan created and approved"
    frequency: "Monthly"

monitoring_thresholds:
  pipeline_success_rate:
    healthy: "> 90%"
    warning: "80-90%"
    critical: "< 80%"
  average_duration:
    healthy: "< 15 minutes"
    warning: "15-30 minutes"
    critical: "> 30 minutes"
  failure_recovery_time:
    healthy: "< 2 hours"
    warning: "2-8 hours"
    critical: "> 8 hours"
  integration_sync_rate:
    healthy: "> 95%"
    warning: "90-95%"
    critical: "< 90%"

automated_actions:
  health_degradation_detected:
    trigger: "Pipeline health score drops below 80%"
    action: "Automatically initiate gitlab-ci-debugging workflow"
    notification: "Alert development team immediately"
  performance_regression:
    trigger: "Average pipeline duration increases by > 50%"
    action: "Generate detailed performance analysis report"
    notification: "Notify team lead and stakeholders"
  integration_failure:
    trigger: "Cross-pack integration sync failure rate > 10%"
    action: "Validate integration configuration and connectivity"
    notification: "Alert integration administrators"
  critical_pipeline_failure:
    trigger: "Pipeline failure on main/production branch"
    action: "Initiate urgent debugging workflow with high priority"
    notification: "Immediate alerts to all stakeholders"

quality_gates:
  - gate: health_baseline_validation
    criteria: "Health assessment data is complete and accurate"
    phase: health_assessment
    blocking: false
  - gate: integration_connectivity
    criteria: "All integration endpoints are reachable and functional"
    phase: integration_health_check
    blocking: true
  - gate: trend_analysis_completeness
    criteria: "Performance trend analysis covers minimum required time period"
    phase: performance_analysis
    blocking: false
  - gate: optimization_impact_validation
    criteria: "Performance optimizations show measurable improvement"
    phase: proactive_optimization
    blocking: true

escalation_procedures:
  health_score_critical:
    trigger: "Overall health score < 60%"
    escalation: "Immediate senior team involvement"
    timeline: "Within 30 minutes"
    actions: ["Initiate emergency debugging session", "Notify all stakeholders"]
  repeated_failures:
    trigger: "Same failure pattern detected 3+ times in 24 hours"
    escalation: "Architectural review required"
    timeline: "Within 4 hours"
    actions: ["Schedule architectural assessment", "Document failure pattern"]
  integration_breakdown:
    trigger: "Complete integration failure for > 2 hours"
    escalation: "Cross-team collaboration session"
    timeline: "Within 1 hour"
    actions: ["Engage integration specialists", "Assess alternative workflows"]

success_patterns:
  high_performing_pipeline:
    characteristics:
      - "Success rate > 95%"
      - "Average duration < 10 minutes"
      - "Failure recovery < 1 hour"
    maintenance_approach: "Light monitoring with trend analysis"
  stable_pipeline:
    characteristics:
      - "Success rate 85-95%"
      - "Average duration 10-20 minutes"
      - "Consistent performance trends"
    maintenance_approach: "Standard monitoring with weekly optimization reviews"
  improvement_needed:
    characteristics:
      - "Success rate < 85%"
      - "Average duration > 20 minutes"
      - "Declining performance trends"
    maintenance_approach: "Intensive monitoring with bi-weekly optimization cycles"

integration_hooks:
  jira_integration:
    - phase: health_assessment
      action: "Update JIRA dashboard with CI health metrics"
    - phase: stakeholder_reporting
      action: "Sync health report data to JIRA project tracking"
  parallel_dev_integration:
    - phase: integration_health_check
      action: "Validate CI coordination across all parallel worktrees"
    - phase: performance_analysis
      action: "Analyze performance impact of parallel development"
  core_bmad_integration:
    - phase: continuous_improvement
      action: "Update BMAD development workflows with monitoring insights"
    - phase: stakeholder_reporting
      action: "Integrate CI health into project status reporting"

reporting_templates:
  daily_health_summary:
    format: "Brief status with key metrics and alerts"
    recipients: ["Development team", "DevOps team"]
    distribution: "Automated via CI/CD status channels"
  weekly_performance_report:
    format: "Detailed analysis with trends and recommendations"
    recipients: ["Team leads", "Project managers", "Stakeholders"]
    distribution: "Email and JIRA dashboard"
  monthly_improvement_review:
    format: "Strategic analysis with improvement plans"
    recipients: ["Senior management", "Architecture team"]
    distribution: "Presentation and documentation"