深夜に起きなくていい運用に、作り替える
SREとしての監視・障害対応体制の構築
- 報酬
- 300,000〜500,000 円 / 月
- 稼働時間
- 40〜60 h / 月
- 勤務形態
- 完全リモート
- 契約形態
- 業務委託
- 開始時期
- 即〜1ヶ月以内
- 企業
- ToB SaaS(物流領域)/従業員50〜100名/シリーズB
- チーム
- 開発10名。SRE専任は不在でバックエンドが兼務
募集背景
SRE専任がおらず、バックエンドエンジニアが持ち回りで障害対応している。アラートの閾値が実態と合っておらず、月に十数回の誤検知でメンバーが疲弊している状態。SLOの定義から監視設計をやり直し、当番制が回る形まで整えたい。
依頼したい業務
- 主要機能のSLO定義とエラーバジェットの設計
- Datadogのモニター再設計とアラート整理
- 障害対応のオンコール手順書とエスカレーションフロー整備
- ポストモーテムのテンプレート作成と初回運用
週の稼働イメージ
週1回の定例(1h)+実務9〜14h。障害の一次対応は担当外です。
必須要件
- SREまたはインフラ運用の実務経験3年以上
- SLO/SLIの設計経験
- クラウド監視ツール(Datadog / New Relic等)の設計経験
歓迎要件
- AWS上でのIaC運用経験(Terraform)
- オンコール体制の立ち上げ経験
こんな人に向いています
- 仕組みを整えて人を楽にすることにやりがいを感じる方
- 現場の運用実態をヒアリングしながら設計できる方
- ドキュメントを書くことを厭わない方
ミスマッチになりやすいケース
- 障害の一次対応要員としての参画を想定される方
- 稼働が月30h未満の方
得られる経験
SRE不在の組織に、SLOと監視設計をゼロから導入した実績
エージェントの一言
開発責任者の方が「まず誤検知を止めたい」と具体的な困りごとを持っておられました。課題が明確なので、初月から成果が見えやすい案件です。既存メンバーが疲弊している自覚があるぶん、提案を歓迎する空気があります。(担当:中村)
選考フロー
書類選考 → エージェント面談 → 企業面談1回(計2回・約2週間)
よくある質問
Q. オンコール当番に入りますか?
A. 入りません。体制設計までがスコープです。
Q. 利用中のクラウドは?
A. AWSです。IaCはTerraformで一部導入済みです。