Skip to content

Infra: Configure Comprehensive Prometheus and Grafana Monitoring Stack #422

Description

@EDOHWARES

Description

Set up unified platform performance monitoring using Prometheus metrics and Grafana dashboards.

Current Problem

There is no visual monitoring of job volumes, queue latencies, database connections, or API error rates, making operations blind to issues.

Proposed Solution

Expose a Prometheus metric endpoint in the backend and configure unified dashboards in Grafana.

Technical Tasks

  • Integrate `prom-client` and export key system metrics (queue sizes, CPU usage, execution errors)
  • Add docker-compose service configurations for Prometheus and Grafana
  • Write pre-configured Grafana dashboards visualizing ingestion rates and latencies
  • Set up alerts in Grafana routing to Discord/Slack on high error rates

Acceptance Criteria

  • Prometheus scrapes metrics successfully from backend containers
  • Grafana displays real-time charts of active queues, completed jobs, and failed actions
  • Dashboards load automatically when spinning up docker-compose

Testing Requirements

  • Generate heavy queue traffic and verify charts render load spikes correctly

Metadata

  • Priority: Medium
  • Difficulty: Medium

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions