lodjdheheu@gmail.com | Telegram | +7 (915) 186-39-37 | Москва, РФ
Занятость: полная · График работы: удаленный · Военный билет: имеется
О себе:
SRE/DevOps-инженер, эксплотирующий production-инфраструктуры. Пришёл из backend-разработки, поэтому подхожу к эксплуатации как к инженерной задаче - пишу код, а не только конфиги
единолично разрабатываю и поддерживаю закрытую Kubernetes-платформу, обслуживающую 100+ клиентов: bare-metal-кластеры на Talos OS, GitOps-доставка, сетевая микросегментация и полный observability-контур
Специализация: bare-metal Kubernetes, GitOps, надёжность и наблюдаемость (SLI/SLO, алертинг, разбор инцидентов), оптимизация приложений по метрикам, трейсам и профилированию CPU/RAM; инфраструктурная разработка на Go - gRPC-сервисы и Kubernetes-операторы
Продукт для ресторанного бизнеса с собственной ML-моделью для интеллектуального бронирования
- Повысил доступность ключевых сервисов с ~99.8% до 99.95%+ за счет миграции в Kubernetes и внедрения SRE практик; обеспечил оперативное реагирование на инциденты
- Спроектировал и построил с нуля закрытую кластерную инфраструктуру на Talos OS (bare-metal) с учётом планов роста бизнеса; масштабировал платформу под рост клиентской базы с ~10 до 100+ - более чем в 10 раз
- Сократил время релиза до 5 минут, полностью автоматизировав CI/CD (GitHub Actions) и доставку по GitOps-модели (FluxCD)
- Внедрил сетевую микросегментацию через Cilium (eBPF) с политикой default-deny, взяв под контроль все межсервисные взаимодействия в кластере
- Построил observability-контур: метрики, логи и трейсы (Prometheus, Grafana, Loki, Tempo, OpenTelemetry, Alloy)
- Настроил GPU-контур для ML-команды (NVIDIA GPU Operator), дав возможность самостоятельно обучать и запускать модели
- Разрабатывал в команде систему управления проектами (аналог Jira) на Java 17 / Spring Boot: администрирование пользователей, аутентификация, настройка серверного окружения, автотесты
Kubernetes и оркестрация: Kubernetes, Helm, Kustomize, Docker, Talos OS, Cilium (eBPF), Gateway API, Ingress, RBAC, Pod Security, Longhorn, NVIDIA GPU Operator, HPA/VPA, cert-manager
CI/CD и IaC: GitOps, FluxCD, ArgoCD, GitHub Actions, Terraform, Ansible, Harbor, Git
Observability и надёжность: Prometheus, Alertmanager, Grafana, Loki, Tempo, Alloy, OpenTelemetry, Pyroscope, SLI/SLO, error budget, incident management, postmortem/RCA, HA, disaster recovery, backup/restore, chaos engineering, fault injection
Linux и сети: сетевой стек и неймспейсы, cgroups/capabilities, отладка нод (immutable OS), Nginx, WireGuard, Bash
Разработка: Go (goroutines, channels, context), Python, gRPC/Protobuf, Kubernetes Operators/Controllers, envtest/Ginkgo
Данные и брокеры: PostgreSQL (CloudNativePG, Patroni), Redis, Kafka, S3-совместимое хранилище
Облака и провайдеры: Hetzner, AWS, GCP, Yandex Cloud
Безопасность: Vault, External Secrets, Keycloak (SSO/OIDC), ACL, PoLP, SSOT, сетевые политики, управление доступом