> ## Documentation Index
> Fetch the complete documentation index at: https://docs.getlimina.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Prometheus metrics endpoint

> This endpoint serves Prometheus metrics via a HTTP-based interface that provides access to metrics data in a format suitable for scraping by Prometheus servers. The endpoint provides real-time insights into how the system is functioning. The endpoint exposed the metrics in a time-series format, allowing you to track various types of data, including system resources usage, application performance, and other custom metrics.

Currently following metrics are available:
* **cpu_usage_percent** (_CPU usage in percentage._)
* **cpu_memory_used_bytes** (_Used CPU memory, in bytes._)
* **cpu_memory_total_bytes** (_Total CPU memory, in bytes._)
* **cpu_load_percent** (_CPU load, in percentage. Calculated for last 1m, 5m & 15m._)
* **http_request_size_bytes** (_HTTP request sizes in bytes grouped by method, status and handler._)
* **http_requests_total** (_Total number of requests grouped by method, status and handler._)
* **http_request_duration_seconds** (_Duration of HTTP requests in seconds._)
* **characters_processed_total** (_Total number of characters processed._)
* Triton metrics (if GPU mode is enabled and Triton server is running.)



## OpenAPI

````yaml /openapi/privateai_4.5.0.json get /metrics
openapi: 3.1.0
info:
  title: API Reference
  description: Private AI API Reference
  termsOfService: https://www.getlimina.ai/en/terms-of-use
  contact:
    url: https://www.getlimina.ai/en/contact-us
    email: info@getlimina.ai
  version: 4.3.0
servers:
  - url: https://api.getlimina.ai/community/v4
    description: Private AI Community API
  - url: https://api.getlimina.ai/professional/v4
    description: Private AI Professional API
  - url: http://localhost:8080
    description: Local Server
security: []
paths:
  /metrics:
    get:
      summary: Prometheus metrics endpoint
      description: >-
        This endpoint serves Prometheus metrics via a HTTP-based interface that
        provides access to metrics data in a format suitable for scraping by
        Prometheus servers. The endpoint provides real-time insights into how
        the system is functioning. The endpoint exposed the metrics in a
        time-series format, allowing you to track various types of data,
        including system resources usage, application performance, and other
        custom metrics.


        Currently following metrics are available:

        * **cpu_usage_percent** (_CPU usage in percentage._)

        * **cpu_memory_used_bytes** (_Used CPU memory, in bytes._)

        * **cpu_memory_total_bytes** (_Total CPU memory, in bytes._)

        * **cpu_load_percent** (_CPU load, in percentage. Calculated for last
        1m, 5m & 15m._)

        * **http_request_size_bytes** (_HTTP request sizes in bytes grouped by
        method, status and handler._)

        * **http_requests_total** (_Total number of requests grouped by method,
        status and handler._)

        * **http_request_duration_seconds** (_Duration of HTTP requests in
        seconds._)

        * **characters_processed_total** (_Total number of characters
        processed._)

        * Triton metrics (if GPU mode is enabled and Triton server is running.)
      operationId: metrics_endpoint_metrics_get
      responses:
        '200':
          description: Successful Response
          content:
            text/plain:
              schema:
                type: string
              example: >
                # HELP characters_processed_total Number of characters processed

                # TYPE characters_processed_total counter

                characters_processed_total 63.0

                # HELP characters_processed_created Number of characters
                processed

                # TYPE characters_processed_created gauge

                characters_processed_created 1.7848166590821865e+09

                # HELP http_request_duration_seconds Duration of HTTP requests
                in seconds

                # TYPE http_request_duration_seconds histogram

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.005",method="POST",status="2xx"}
                0.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.01",method="POST",status="2xx"}
                0.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.025",method="POST",status="2xx"}
                0.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.05",method="POST",status="2xx"}
                0.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.075",method="POST",status="2xx"}
                0.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.1",method="POST",status="2xx"}
                0.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.25",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.5",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="0.75",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="1.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="2.5",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="5.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="7.5",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="10.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="25.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="50.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="75.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="100.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="250.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="500.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="750.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="1000.0",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_bucket{handler="/analyze/text",le="+Inf",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_count{handler="/analyze/text",method="POST",status="2xx"}
                1.0

                http_request_duration_seconds_sum{handler="/analyze/text",method="POST",status="2xx"}
                0.10682842321693897

                # HELP http_request_duration_seconds_created Duration of HTTP
                requests in seconds

                # TYPE http_request_duration_seconds_created gauge

                http_request_duration_seconds_created{handler="/analyze/text",method="POST",status="2xx"}
                1.7848166708028271e+09

                # HELP http_requests_total Total number of requests by method,
                status and handler.

                # TYPE http_requests_total counter

                http_requests_total{handler="/analyze/text",method="POST",status="2xx"}
                1.0

                # HELP http_requests_created Total number of requests by method,
                status and handler.

                # TYPE http_requests_created gauge

                http_requests_created{handler="/analyze/text",method="POST",status="2xx"}
                1.7848166708029535e+09

                # HELP http_request_size_bytes Content bytes of requests.

                # TYPE http_request_size_bytes summary

                http_request_size_bytes_count{handler="/analyze/text",method="POST",status="2xx"}
                1.0

                http_request_size_bytes_sum{handler="/analyze/text",method="POST",status="2xx"}
                81.0

                # HELP http_request_size_bytes_created Content bytes of
                requests.

                # TYPE http_request_size_bytes_created gauge

                http_request_size_bytes_created{handler="/analyze/text",method="POST",status="2xx"}
                1.78481667080302e+09

                # HELP cpu_usage_percent CPU usage, in percentage

                # TYPE cpu_usage_percent gauge

                cpu_usage_percent 5.6

                # HELP cpu_memory_used_bytes CPU used memory, in bytes

                # TYPE cpu_memory_used_bytes gauge

                cpu_memory_used_bytes 1.0639978496e+010

                # HELP cpu_memory_total_bytes CPU total memory, in bytes

                # TYPE cpu_memory_total_bytes gauge

                cpu_memory_total_bytes 6.7361595392e+010

                # HELP cpu_load_percent CPU load, in percentage. Calculated for
                last 1m, 5m & 15m.

                # TYPE cpu_load_percent gauge

                cpu_load_percent{duration="1m"} 2.764892578125

                cpu_load_percent{duration="5m"} 1.6642252604166667

                cpu_load_percent{duration="15m"} 1.409912109375


                # Triton Server Metrics Examples:

                # HELP nv_gpu_utilization GPU utilization in percentage

                # TYPE nv_gpu_utilization gauge

                nv_gpu_utilization{gpu=0} 45.2

                # HELP nv_gpu_memory_used_bytes GPU memory used in bytes

                # TYPE nv_gpu_memory_used_bytes gauge

                nv_gpu_memory_used_bytes{gpu=0} 8589934592.0

                # HELP triton_inference_request_success Total number of
                successful requests

                # TYPE triton_inference_request_success counter

                triton_inference_request_success{model="deid_model"} 150.0

````