Monitoring & Alerts

Monitoring stack includes Prometheus for metrics and Grafana for visualization.

Key Metrics

Metric Description Alert Threshold

pod_cpu_usage

CPU utilization %

> 80%

pod_memory_usage

Memory utilization %

> 85%

http_request_duration_seconds

API response time

p95 > 2s

http_requests_total

Request rate

N/A

error_rate

Error percentage

> 1%

ServiceMonitors

Prometheus scrapes metrics from:

  • FTACS: /metrics

  • UI Backend: /actuator/prometheus

  • APIs: /metrics

Grafana Dashboards

  • FT Services Overview

  • Database Performance

  • API Performance

  • Resource Usage

  • Logs Dashboard (Loki)

Alert Rules

groups:
- name: ft-services
  rules:
  - alert: HighErrorRate
    expr: rate(http_requests_total{status=~"5.."}[5m]) > 0.01
    for: 5m
    annotations:
      summary: "High error rate detected"

Full monitoring configuration in Prometheus/Grafana setup.