Federal Frontier SME Catalog
Living inventory of 69 SMEs (5 ga / 11 lab / 53 planned) that the SRE Investigator routes through Remuda tool slices and posse roles.
The SRE Investigator (opencode-runner) routes alerts to platform
specialists (SMEs) from this catalog. An SME is a named harness shape:
Remuda namespace slice + first tools + scout brief. It productizes FFP posse
roles (Scout / Sage / Wrangler / Marshal) onto Remuda tool slices - one
Investigator binary, many specialist shapes (ADR-033).
The catalog inventories 69 SMEs (5 ga, 11 lab, 53 planned).
Maturity (status): ga = classifiers and Remuda path wired for auto-route;
lab = Federal Frontier lab-wired; planned = platform roadmap depth
(inventory stays visible; auto-route waits until tools and classifiers land).
| id | display_name | domain | status | remuda_path | first_tools | when it fires |
|---|---|---|---|---|---|---|
alertmanager |
Alertmanager Routing | observability | lab |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | AlertmanagerClusterDown, AlertmanagerFailedReload |
argocd-sync |
Argo CD Sync / App Health | gitops | lab |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | ArgoAppSyncFailed, ArgoAppUnhealthy, ArgocdAppDegraded |
capo-cluster-api |
Cluster API Provider OpenStack (CAPO) | platform | planned |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | capo, cluster-api, openstackmachine |
ceph-mon |
Ceph MON Quorum | storage | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | ceph mon, mon quorum |
ceph-osd |
Ceph OSD Deep Dive | storage | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | ceph osd, osd down, pg degraded |
ceph-rgw |
Ceph RGW Object Gateway | storage | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | ceph rgw, radosgw, s3 gateway |
ceph-storage |
Ceph / Rook Storage | storage | lab |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | CephHealthError, CephOSDDown, CephMonQuorumAtRisk |
cert-manager |
cert-manager / TLS Certificates | security | planned |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | cert-manager, certificate expired, acme challenge |
elasticsearch-logs |
Elasticsearch / OpenSearch | observability | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | elasticsearch, opensearch, cluster health red |
external-dns |
ExternalDNS | networking | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | external-dns, externaldns |
external-secrets |
External Secrets Operator | security | planned |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | externalsecret, secretstore, external-secrets |
falco-runtime |
Falco Runtime Security | security | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | falco, runtime security, syscall anomaly |
fas-authz |
FAS Authorization / Warrant | identity | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | fas, warrant pep, statute bundle |
ffo-typedb |
FFO TypeDB Facility Graph | ffo | lab |
/public/mcp |
k8s_get, k8s_logs, k8s_events | FfoMcpDown, TypeDBDown, FfoFacilityQueryFailed |
flux-cd |
Flux CD Reconciliation | gitops | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | flux, kustomization, helmrelease |
frontier-outrider |
Frontier Outrider Migration | platform | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | outrider, frontier-outrider |
generic |
Generic Investigator (Wide Remuda) | general | ga |
/public/mcp |
k8s_get, k8s_events | fallback / unknown |
gitlab-ci-runners |
GitLab CI Runners | ci | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | gitlab runner, gitlab-ci, ci job failed |
gitlab-omnibus |
GitLab Omnibus / Rails | ci | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | gitlab, gitaly, sidekiq |
gpu-operator |
NVIDIA GPU Operator | compute | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | gpu, nvidia.com, gpu operator |
grafana-stack |
Grafana Stack | observability | lab |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | GrafanaDown, GrafanaDatasourceError |
harbor-registry |
Harbor Container Registry | registry | lab |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | HarborDown, HarborJobserviceError, HarborRegistryError |
istio-service-mesh |
Istio / Service Mesh | networking | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | istio, istiod, envoy filter |
k8s-dns |
Kubernetes DNS / CoreDNS | networking | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | coredns, dns resolution, nxdomain |
k8s-hpa |
Kubernetes HPA / Autoscaling | kubernetes | planned |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | horizontalpodautoscaler, hpa, metrics-server |
k8s-imagepull |
Kubernetes ImagePullBackOff | kubernetes | ga |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | ImagePullBackOff, ErrImagePull |
k8s-job-cronjob |
Kubernetes Job / CronJob | kubernetes | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | cronjob, job failed, backofflimit |
k8s-network-policy |
Kubernetes NetworkPolicy | networking | planned |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | networkpolicy, netpol |
k8s-node-pressure |
Kubernetes Node Pressure | kubernetes | lab |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | KubeNodePressure, NodeNotReady, KubeNodeNotReady |
k8s-oom |
Kubernetes OOM / Memory Pressure | kubernetes | ga |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | PodOOMKilled, KubePodOOMKilled, ContainerOOMKilled |
k8s-pod-crash |
Kubernetes Pod CrashLoop | kubernetes | ga |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | KubePodCrashLooping, KubePodNotReady, KubeContainerWaiting |
k8s-scheduling |
Kubernetes Scheduling / Pending Pods | kubernetes | planned |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | failedscheduling, pending pod, unschedulable |
k8s-service-endpoints |
Kubernetes Service / Endpoints | networking | planned |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | endpoints empty, no endpoints, service unavailable |
k8s-storage |
Kubernetes PVC / Disk Pressure | kubernetes | ga |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | KubePersistentVolumeFillingUp, KubePersistentVolumeErrors, PersistentVolumeClaimPending |
kafka-messaging |
Kafka / Redpanda Messaging | data | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | kafka, redpanda, underreplicated |
keycloak-oidc |
Keycloak / OIDC (FAS) | identity | lab |
/public/mcp |
k8s_get, k8s_logs, k8s_events | KeycloakDown, KeycloakRealmError, OidcTokenFailures |
knative-serving |
Knative Serving | platform | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | knative, ksvc, revision failed |
kyverno-policy |
Kyverno Policy Engine | security | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | kyverno, policy report, clusterpolicy |
lightbits-nvme |
Lightbits NVMe/TCP Storage | storage | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | lightbits, nvme/tcp, lb-csi |
linkerd-service-mesh |
Linkerd Service Mesh | networking | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | linkerd, linkerd-viz |
loki-logs |
Loki Log Stack | observability | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | loki, logql, loki-stack |
longhorn-volumes |
Longhorn Distributed Block | storage | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | longhorn, longhorn volume |
metallb-lb |
MetalLB Load Balancer | networking | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | metallb, ipaddresspool, bgp peer |
mimir-metrics |
Mimir / Long-term Metrics | observability | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | mimir, cortex, long-term metrics |
minio-object |
MinIO Object Storage | storage | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | minio, s3 minio |
mongodb-operator |
MongoDB / Operator | data | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | mongodb, mongo operator |
nginx-ingress |
NGINX Ingress Controller | networking | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | nginx-ingress, ingress-nginx, upstream timed out |
opa-gatekeeper |
OPA Gatekeeper | security | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | gatekeeper, constraint template, opa gatekeeper |
opencode-investigator |
OpenCode Investigator Runner | platform | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | opencode-runner, local scout, investigator job |
openstack-cinder |
OpenStack Cinder Block Storage | openstack | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | cinder, openstack volume |
openstack-glance |
OpenStack Glance Images | openstack | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | glance, openstack image |
openstack-keystone |
OpenStack Keystone Identity | openstack | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | keystone, openstack identity |
openstack-neutron |
OpenStack Neutron Networking | openstack | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | neutron, openstack network, floating ip |
openstack-nova |
OpenStack Nova Compute | openstack | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | nova, openstack compute, hypervisor |
opentelemetry-collector |
OpenTelemetry Collector | observability | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | opentelemetry, otelcol, otel-collector |
postgres-operator |
PostgreSQL / Operator | data | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | postgres, postgresql, patroni |
prometheus-stack |
Prometheus / kube-prometheus | observability | lab |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | PrometheusDown, PrometheusTargetMissing, PrometheusRuleFailures |
rabbitmq-messaging |
RabbitMQ Messaging | data | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | rabbitmq, amqp |
redis-cache |
Redis / Valkey Cache | data | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | redis, valkey, sentinel |
remuda-mcp |
Remuda / Wanaku MCP Registry | mcp | lab |
/public/mcp |
k8s_get, k8s_logs, k8s_events | RemudaRouterDown, WanakuMcpError, McpRegistryUnavailable |
rke2-cluster |
RKE2 / Rancher Downstream | platform | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | rke2, rancher, k3s agent |
sealed-secrets |
Sealed Secrets Controller | security | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | sealedsecret, sealed-secrets |
sre-dispatch |
SRE Dispatch Controller | platform | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | sre-dispatch, dispatch controller |
tempo-traces |
Tempo / Distributed Traces | observability | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | tempo, traceql, jaeger-query |
traefik-ingress |
Traefik Ingress / Routes | networking | lab |
/ns-9/mcp |
k8s_get, k8s_describe, k8s_events | TraefikDown, IngressRouteError |
trivy-scanner |
Trivy / Image CVE Scan | security | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | trivy, vulnerability report, cve critical |
vault-secrets |
HashiCorp Vault / Secrets | security | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | vault, hashicorp vault, secret engine |
vdi-session |
VDI / Remote Desktop Sessions | compute | planned |
/public/mcp |
k8s_get, k8s_logs, k8s_events | vdi, guacamole, remote desktop |
velero-backup |
Velero Backup / Restore | dr | planned |
/ns-9/mcp |
k8s_get, k8s_logs, k8s_events | velero, backup failed, restore failed |
Living inventory exported from python -m app.playbooks (ADR-033).