Agent Plugins Marketplace
All plugins

google-cloud-gke

v1.0.0

Google Kubernetes Engine guidance for coding agents: clusters, networking, scaling, security, observability, cost, and AI inference.

CodexClaude CodeAgent Plugins29 Skills1 MCP serverStreamable HTTP

18.6k GitHub starsUpdated 8 hours ago

Directory evidence

Runtimes
Codex, Claude Code, and Agent Plugins
Parsed components
30 skill or MCP entries
Source updated
Aug 21, 2026
Manifest status
Canonical path parsed

The directory validates manifest shape and source location. It does not execute the plugin or provide a security endorsement. Review the indexing methodology

Install plugin

Installs for the current user
codex plugin marketplace add IchenDEV/agent-plugin-mkt
codex plugin marketplace upgrade agent-plugin-marketplace
codex plugin add google-cloud-gke@agent-plugin-marketplace

Paste and run these commands in a terminal with Codex. They add and refresh the PluginsMP catalog, then install this plugin.

The installer fetches third-party code from the source repository shown on this page. This directory validates manifest structure and source location, but does not perform a security audit; review the manifest, components, and source before installing.

Get the source manually
git clone https://github.com/google/skills

Clone the source repository, then follow its setup instructions to add the plugin to a compatible client. The plugin root is plugins/cloud/google-cloud-gke/.

Plugin files

plugins/cloud/google-cloud-gke/
├── .codex-plugin/plugin.json
├── .claude-plugin/plugin.json
├── plugin.json
├── skills/gke-ai-troubleshooting-handle-disruption-gpu-tpu/SKILL.md
├── skills/gke-ai-troubleshooting-jobset-interruption/SKILL.md
├── skills/gke-ai-troubleshooting-tpu-dynamic-slices-monitoring/SKILL.md
├── skills/gke-ai-troubleshooting-tpu-metrics-monitoring/SKILL.md
├── skills/gke-ai-troubleshooting-tpu-vbar-oom/SKILL.md
├── skills/gke-app-onboarding/SKILL.md
├── skills/gke-backup-dr/SKILL.md
├── skills/gke-basics/SKILL.md
├── skills/gke-batch-hpc/SKILL.md
├── skills/gke-cluster-autoscaler/SKILL.md
├── skills/gke-cluster-creation/SKILL.md
├── skills/gke-compute-classes/SKILL.md
├── skills/gke-cost-analysis/SKILL.md
├── skills/gke-cost-optimization/SKILL.md
├── skills/gke-golden-path/SKILL.md
├── skills/gke-inference/SKILL.md
├── skills/gke-manifest-generation/SKILL.md
├── skills/gke-multitenancy/SKILL.md
├── skills/gke-networking/SKILL.md
├── skills/gke-observability/SKILL.md
├── skills/gke-platform-security/SKILL.md
├── skills/gke-productionize/SKILL.md
├── skills/gke-reliability/SKILL.md
├── skills/gke-service-networking/SKILL.md
├── skills/gke-storage/SKILL.md
├── skills/gke-upgrades/SKILL.md
├── skills/gke-workload-scaling/SKILL.md
├── skills/gke-workload-security/SKILL.md
├── skills/gke-workload-troubleshooting/SKILL.md
└── .mcp.json

Included Skills29

gke-ai-troubleshooting-handle-disruption-gpu-tpuskills/gke-ai-troubleshooting-handle-disruption-gpu-tpu/SKILL.md

Diagnoses, predicts, and mitigates node disruptions during Compute Engine host maintenance and hardware or software maintenance events for GPU and TPU workloads on GKE. Use when diagnosing node disruptions, predicting host maintenance events on GPU/TPU nodepools, inspecting node interruption PromQL metrics, auditing node taints, or configuring workload protection strategies (graceful termination, opportunistic maintenance, PodDisruptionBudgets). Don't use for general GKE cluster creation, network policy configuration, or non-disruption workload deployment.

gke-ai-troubleshooting-jobset-interruptionskills/gke-ai-troubleshooting-jobset-interruption/SKILL.md

Diagnoses GKE JobSet interruptions, restarts, and preemptions for AI/ML training workloads autonomously. Use when troubleshooting JobSet restart loops, spot VM preemptions, node readiness failures, host VM issues, or coordinator worker crashes. Don't use for general GKE cluster creation, basic workload deployment, or non-JobSet application issues.

gke-ai-troubleshooting-tpu-dynamic-slices-monitoringskills/gke-ai-troubleshooting-tpu-dynamic-slices-monitoring/SKILL.md

Monitors, troubleshoots, and manages GKE TPU Dynamic Slices custom resources. Use when checking TPU slice lifecycle states, troubleshooting slice provisioning failures, validating single-slice or multi-slice (JobSet) workload manifests, or safely patching stuck finalizers and disabling the slice controller. Don't use for generic GKE cluster node pool creation or standard non-TPU workload management (use gke-basics or gke-cluster-creation instead).

gke-ai-troubleshooting-tpu-metrics-monitoringskills/gke-ai-troubleshooting-tpu-metrics-monitoring/SKILL.md

Monitors and troubleshoots GKE TPU workloads, nodes, and node pools using GKE system metrics and PromQL. Use when monitoring TensorCore duty cycle, TPU memory, node readiness, multi-host TPU node pool availability, host maintenance or preemption interruptions, and calculating MTTR or MTBI metrics for GKE TPUs. Don't use for general non-TPU GKE workload monitoring or non-metric TPU debugging.

gke-ai-troubleshooting-tpu-vbar-oomskills/gke-ai-troubleshooting-tpu-vbar-oom/SKILL.md

Diagnoses and prevents vbar_control_agent segfaults, out-of-memory (OOM) errors, and TPU device initialization failures on TPU v6e nodes in GKE caused by race conditions during TPU device resets or high-frequency metrics polling. Use when troubleshooting vbar_control_agent crashes, memory cgroup OOMs in serial console logs, tpu-device-plugin metrics checksum corruption errors, or custom TPU metrics collection conflicts on GKE TPU v6e nodes. Don't use for general non-TPU container OOM troubleshooting or standard GKE node lifecycle operations.

gke-app-onboardingskills/gke-app-onboarding/SKILL.md

Manages GKE application onboarding, covering containerization, deployment manifests, and migration. Use when onboarding or deploying an application to GKE for the first time, or containerizing an app for GKE. Don't use for general GKE cluster administration or upgrades (use gke-basics or gke-upgrades instead).

gke-backup-drskills/gke-backup-dr/SKILL.md

Configures GKE Backup Plans and restore workflows. Use for backup policies, disaster recovery, or GKE cluster restores. Don't use for database backups.

gke-basicsskills/gke-basics/SKILL.md

Manages core GKE cluster provisioning, credentials, Autopilot vs Standard selection, and workload deployment. Use when creating GKE clusters, fetching kubectl credentials, configuring Workload Identity, or deciding between Autopilot and Standard modes. Don't use for specialized GKE networking (use gke-networking), advanced security hardening (use gke-platform-security or gke-workload-security), or cluster upgrades (use gke-upgrades).

gke-batch-hpcskills/gke-batch-hpc/SKILL.md

Runs batch and HPC workloads on GKE, utilizing job queues and parallel processing. Use when running GKE batch jobs, configuring GKE HPC, or setting up GKE job queues. Don't use for standard web application deployments (use gke-app-onboarding instead).

gke-cluster-autoscalerskills/gke-cluster-autoscaler/SKILL.md

Trigger on mention of GKE cluster autoscaler, node autoscaling, node pool auto-creation / node auto-provisioning. Provides guidance on enabling and optimizing cluster autoscaler, best practices, and troubleshooting issues such as nodes not scaling up or down, zonal stockouts, or capacity buffers. Do not use for ComputeClass-specific YAML generation or priority configuration (defer to gke-compute-classes skill).

gke-cluster-creationskills/gke-cluster-creation/SKILL.md

Plans and executes GKE cluster creation, provisioning, and production readiness audits using pre-defined templates (Autopilot, Standard Regional, GPU/AI Inference, AI Hypercompute). Use when creating GKE clusters, provisioning GKE environments, selecting cluster modes, or auditing GKE clusters. Don't use for application onboarding or deployment configuration (use gke-app-onboarding instead).

gke-compute-classesskills/gke-compute-classes/SKILL.md

Configures, optimizes, and troubleshoots GKE ComputeClasses. Use when configuring Spot VMs with on-demand fallback, targeting specific accelerators (GPUs/TPUs) or machine families, restricting ComputeClass access, or debugging pending pods related to node pool auto-creation. Do not use for cluster-level Node Auto Provisioning configuration or general GKE cluster creation.

gke-cost-analysisskills/gke-cost-analysis/SKILL.md

Answer natural language questions and perform analysis on GKE cluster and workload costs using BigQuery billing exports, cost allocation data, and live cluster monitoring metrics. Use when querying GKE costs across projects, namespaces, or workloads, analyzing billing reports in BigQuery (`bq`), checking cluster cost budgets (`gcloud billing`), or diagnosing cost drivers like pod requests vs. actual utilization (`kubectl top`). Don't use for applying cost optimization changes, creating rightsizing manifests (VPA/MPA), or selecting ComputeClasses (use gke-cost-optimization instead).

gke-cost-optimizationskills/gke-cost-optimization/SKILL.md

Optimizes GKE costs, rightsizes workloads, and configures Spot VMs, CUDs, cost allocation, and resource quotas. Use when optimizing GKE cluster or workload costs, configuring GKE cost allocation or quotas, rightsizing CPU/memory requests, or selecting Spot VMs and machine types. Don't use for general compute class provisioning or GPU Selection (use gke-compute-classes instead).

gke-golden-pathskills/gke-golden-path/SKILL.md

Provides GKE golden path configuration defaults, production readiness checklists, and cluster default patterns. Use when designing GKE clusters, verifying GKE production readiness, or checking configurations against GKE defaults. Don't use for setting up workload autoscaling specifically (use gke-workload-scaling instead).

gke-inferenceskills/gke-inference/SKILL.md

Deploys and optimizes AI/ML inference workloads on GKE, using GPUs, TPUs, and model servers. Use when deploying GKE inference servers, configuring GKE GPU resources for inference, or deploying LLMs on GKE. Don't use for generic batch jobs or HPC task queues (use gke-batch-hpc instead).

gke-manifest-generationskills/gke-manifest-generation/SKILL.md

Generates and updates secure, production-ready Kubernetes YAML manifests optimized for GKE Autopilot and GKE Standard clusters. Use when creating or modifying GKE deployment manifests, configuring container security contexts, setting CPU/memory resource limits, defining readiness/liveness/startup probes, mounting secrets and volumes, configuring GKE Gateway API routes, targeting Spot VMs, or deploying AI model inference workloads (vLLM, TGI, Gemma). Don't use for live cluster operations, pod troubleshooting (use gke-workload-troubleshooting), or cluster infrastructure provisioning (use gke-cluster-creation).

gke-multitenancyskills/gke-multitenancy/SKILL.md

Plans and configures multi-tenancy on GKE. Covers namespace isolation, RBAC planning for teams, resource quotas, LimitRanges, network isolation, and cost allocation. Use when designing GKE multi-tenancy, configuring GKE namespaces, setting up resource quotas, or isolating GKE teams. Don't use for single-tenant cluster configuration or general deployment instructions (use gke-basics or gke-app-onboarding instead).

gke-networkingskills/gke-networking/SKILL.md

Plans, configures, and manages core GKE cluster networking. Covers private clusters, VPC-native configurations, DNS, node egress, Dataplane V2, and IP planning. Use when designing GKE networking layouts, configuring private clusters, setting up Dataplane V2, planning GKE IP ranges, or managing VPC- native cluster modes. Don't use for application ingress, load balancing, or service networking (use gke-service-networking instead).

gke-observabilityskills/gke-observability/SKILL.md

Configures GKE observability, including Cloud Logging, Cloud Monitoring, and managed Prometheus. Use when configuring GKE monitoring, setting up GKE logging, or configuring Prometheus metrics collection. Don't use to configure local application logging frameworks or external APMs outside GKE.

gke-platform-securityskills/gke-platform-security/SKILL.md

Plans, configures, and hardens platform-level Google Kubernetes Engine (GKE) cluster security. Covers cluster add-ons (Secret Manager enablement), RBAC hardening (disabling insecure bindings, audit tools), Binary Authorization, enabling Shielded Nodes, GKE Sandbox cluster enablement, GKE IAM roles, and cross-service authentication IAM patterns. Use when securing cluster control planes, hardening GKE RBAC, enabling Shielded Nodes, enabling GKE Sandbox runtime, enabling cluster-wide security add-ons, or managing GKE IAM roles. Don't use for workload-level security (Workload Identity, SecretProviderClass, PSS, NetPol, gVisor pod runtimeClassName; use gke-workload-security instead).

gke-productionizeskills/gke-productionize/SKILL.md

Orchestrates comprehensive production readiness reviews and assessments for GKE clusters and workloads across scalability, security, reliability, observability, backup/DR, and cost optimization. Use when asked to productionize, prepare, assess, audit, or review a GKE cluster or workload before going live to production. Don't use for deep-dive single-domain implementation (use specific domain skills like gke-workload-scaling, gke-platform-security, gke-workload-security, gke-service-networking, gke-reliability instead).

gke-reliabilityskills/gke-reliability/SKILL.md

Improves GKE workload reliability, using PDBs, health probes, and topology spread constraints. Use when configuring GKE workload reliability, setting up PDBs, or configuring GKE health probes (liveness, readiness, startup). Don't use for disaster recovery setup or full cluster backups (use gke-backup-dr instead).

gke-service-networkingskills/gke-service-networking/SKILL.md

Configures GKE edge networking, traffic routing, load balancing, and private service endpoints. Use when configuring Gateway API manifests, standard Ingress, Cloud Armor WAF security policies, Container-Native Load Balancing (NEGs), Private Service Connect (PSC), or Google-managed SSL certificates on GKE. Don't use for core cluster IP planning, Dataplane V2 network policies, or node NAT egress (use gke-networking instead).

gke-storageskills/gke-storage/SKILL.md

Manages GKE storage, including PVCs, PersistentVolumes, Filestore, and GCS FUSE. Use when configuring GKE storage, creating PVCs, or setting up GCS FUSE on GKE. Don't use for database administration or replication strategies outside volume provisioning context.

gke-upgradesskills/gke-upgrades/SKILL.md

Plans, executes, and validates Google Kubernetes Engine (GKE) cluster upgrades and maintenance operations for both Standard and Autopilot clusters. Produces upgrade plans, pre/post-upgrade checklists, maintenance runbooks with gcloud commands, release channel strategy, and troubleshooting guides. Handles node pool upgrade strategies (surge, blue-green), version compatibility, PDB management, and workload-specific concerns (stateful, GPU, operators). Use this skill whenever the user mentions GKE upgrades, Kubernetes version bumps, node pool maintenance, GKE patching, cluster version management, release channel selection, maintenance windows, surge upgrades, stuck upgrades, or any GKE lifecycle management task — even casual mentions like "we need to upgrade our clusters" or "plan our next GKE maintenance" or "our upgrade is stuck." Don't use for GKE cluster creation, application onboarding, general networking/routing setup, or security policy configurations (use gke-basics or relevant GKE skills instead).

gke-workload-scalingskills/gke-workload-scaling/SKILL.md

Manages scaling for GKE workloads using HPA and VPA. Use when configuring Horizontal Pod Autoscaler (HPA), configuring Vertical Pod Autoscaler (VPA), or applying best practices for GKE workload autoscaling. Do not use for cluster-level autoscaling (Cluster Autoscaler), static cluster sizing, or configuring node-level machine styles directly.

gke-workload-securityskills/gke-workload-security/SKILL.md

Audits, configures, and hardens workload-level security controls for Google Kubernetes Engine (GKE) applications and namespaces. Covers running cluster security audits (`audit_cluster.sh`), configuring Workload Identity Federation (impersonation, KSA/GSA binding, and pod setup), enforcing Network Policies (default-deny and Dataplane V2 logging), isolating high-risk pods inside GKE Sandbox (`gVisor`), enforcing Pod Security Standards (`restricted` labeling), and mounting Secret Manager secrets via CSI (`SecretProviderClass`). Use when auditing cluster security posture, isolating namespaces, applying pod security standards, setting up Workload Identity, or configuring network policies and secret volume mounts. Don't use for cluster-wide control plane security, RBAC hardening, Binary Authorization, Shielded Nodes, or enabling platform-level GKE add-ons (use gke-platform-security instead).

gke-workload-troubleshootingskills/gke-workload-troubleshooting/SKILL.md

Diagnoses GKE workload failures (CrashLoopBackOff, OOMKilled, ImagePullBackOff, Pending, etc.) via logs and events. Use when pods fail to start or crash repeatedly. Don't use for GKE cluster infrastructure provisioning, node pool creation, or non-Kubernetes Google Cloud services.

MCP servers1

gkeStreamable HTTP
url
https://container.googleapis.com/mcp

Plugin manifests3

plugins/cloud/google-cloud-gke/.codex-plugin/plugin.json
{
  "name": "google-cloud-gke",
  "version": "1.0.0",
  "description": "Google Kubernetes Engine guidance for coding agents: clusters, networking, scaling, security, observability, cost, and AI inference.",
  "skills": "./skills/",
  "interface": {
    "displayName": "Google Kubernetes Engine",
    "shortDescription": "GKE clusters, workloads, scaling, and AI inference",
    "category": "Productivity"
  }
}
plugins/cloud/google-cloud-gke/.claude-plugin/plugin.json
{
  "name": "google-cloud-gke",
  "version": "1.0.0",
  "description": "Google Kubernetes Engine guidance for coding agents: clusters, networking, scaling, security, observability, cost, and AI inference.",
  "author": {
    "name": "Google LLC"
  }
}
plugins/cloud/google-cloud-gke/plugin.json
{
  "$schema": "https://agent-plugins.org/schemas/1.0.0/plugin.schema.json",
  "name": "google-cloud-gke",
  "version": "1.0.0",
  "description": "Google Kubernetes Engine guidance for coding agents: cluster creation and upgrades, networking and storage, autoscaling and compute classes, workload and platform security, observability, cost analysis, batch and HPC workloads, AI inference on GPU and TPU, and troubleshooting. Includes the GKE MCP server for grounded access to the Kubernetes Engine API.",
  "author": {
    "name": "Google LLC",
    "url": "https://cloud.google.com"
  },
  "homepage": "https://github.com/google/skills/tree/main/plugins/cloud/google-cloud-gke",
  "repository": "https://github.com/google/skills",
  "license": "Apache-2.0",
  "keywords": [
    "google-cloud",
    "gke",
    "kubernetes",
    "containers"
  ]
}

If you maintain this plugin, link to this source-backed listing from your README so users can review its manifest and indexed components.

[google-cloud-gke on Agent Plugins Marketplace](https://pluginsmp.com/plugins/google-cloud-gke)