251-300 of 10000 results (120ms)
2026-07-20 §
10:26 <mvernon@cumin2003> START - Cookbook sre.hosts.downtime for 2:00:00 on ms-be2069.codfw.wmnet with reason: host reimage [production]
10:06 <blake@deploy2003> Stopping before sync operations [production]
10:06 <blake@deploy2003> Started scap sync-world: Non-deployment scap run to populate new release values [production]
10:05 <mvernon@cumin2003> START - Cookbook sre.hosts.reimage for host ms-be2069.codfw.wmnet with OS trixie [production]
10:00 <mvernon@cumin1003> END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host ms-be1073.eqiad.wmnet with OS trixie [production]
09:56 <elukey@cumin1003> START - Cookbook sre.hosts.bmc-user-mgmt for 324 hosts [production]
09:39 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
09:39 <elukey@cumin1003> END (PASS) - Cookbook sre.hosts.bmc-user-mgmt (exit_code=0) for 8 hosts [production]
09:38 <mvernon@cumin1003> END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on ms-be1073.eqiad.wmnet with reason: host reimage [production]
09:37 <elukey@cumin1003> START - Cookbook sre.hosts.bmc-user-mgmt for 8 hosts [production]
09:34 <mvernon@cumin1003> START - Cookbook sre.hosts.downtime for 2:00:00 on ms-be1073.eqiad.wmnet with reason: host reimage [production]
09:19 <mvernon@cumin2003> END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host ms-be2068.codfw.wmnet with OS trixie [production]
09:16 <mvernon@cumin1003> START - Cookbook sre.hosts.reimage for host ms-be1073.eqiad.wmnet with OS trixie [production]
09:13 <blake@deploy2003> sync-world aborted: Non-deployment scap run to populate new release values (duration: 00m 02s) [production]
09:13 <blake@deploy2003> Started scap sync-world: Non-deployment scap run to populate new release values [production]
08:59 <mvernon@cumin2003> END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on ms-be2068.codfw.wmnet with reason: host reimage [production]
08:52 <mvernon@cumin2003> START - Cookbook sre.hosts.downtime for 2:00:00 on ms-be2068.codfw.wmnet with reason: host reimage [production]
08:50 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
08:32 <mvernon@cumin2003> START - Cookbook sre.hosts.reimage for host ms-be2068.codfw.wmnet with OS trixie [production]
08:15 <mvernon@cumin1003> END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host ms-be1072.eqiad.wmnet with OS trixie [production]
07:59 <mvernon@cumin2003> END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host ms-be2067.codfw.wmnet with OS trixie [production]
07:54 <mvernon@cumin1003> END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on ms-be1072.eqiad.wmnet with reason: host reimage [production]
07:49 <mvernon@cumin1003> START - Cookbook sre.hosts.downtime for 2:00:00 on ms-be1072.eqiad.wmnet with reason: host reimage [production]
07:45 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
07:45 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
07:39 <mvernon@cumin2003> END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on ms-be2067.codfw.wmnet with reason: host reimage [production]
07:35 <mvernon@cumin2003> START - Cookbook sre.hosts.downtime for 2:00:00 on ms-be2067.codfw.wmnet with reason: host reimage [production]
07:30 <brouberol@deploy2003> helmfile [dse-k8s-codfw] DONE helmfile.d/admin 'apply'. [production]
07:30 <mvernon@cumin1003> START - Cookbook sre.hosts.reimage for host ms-be1072.eqiad.wmnet with OS trixie [production]
07:30 <brouberol@deploy2003> helmfile [dse-k8s-codfw] START helmfile.d/admin 'apply'. [production]
07:17 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
07:15 <mvernon@cumin2003> START - Cookbook sre.hosts.reimage for host ms-be2067.codfw.wmnet with OS trixie [production]
05:51 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
05:50 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
05:25 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
05:25 <marostegui@cumin1003> DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 5 days, 0:00:00 on db2207.codfw.wmnet with reason: Host down [production]
04:28 <kevinbazira@deploy2003> helmfile [ml-staging-codfw] 'sync' command on namespace 'tts-section-generator' for release 'main' . [production]
02:07 <mwpresync@deploy2003> Finished scap build-images: Publishing wmf/next image (duration: 07m 02s) [production]
02:00 <mwpresync@deploy2003> Started scap build-images: Publishing wmf/next image [production]
2026-07-18 §
02:06 <mwpresync@deploy2003> Finished scap build-images: Publishing wmf/next image (duration: 06m 29s) [production]
02:00 <mwpresync@deploy2003> Started scap build-images: Publishing wmf/next image [production]
00:11 <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs2018.codfw.wmnet, repooling source-only afterwards [production]
2026-07-17 §
23:53 <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer scholarly_articles from wdqs2017.codfw.wmnet -> wdqs2026.codfw.wmnet, repooling source-only afterwards [production]
23:09 <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs2018.codfw.wmnet, repooling source-only afterwards [production]
23:08 <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer scholarly_articles from wdqs2017.codfw.wmnet -> wdqs2026.codfw.wmnet, repooling source-only afterwards [production]
22:11 <bking@cumin2003> END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host wdqs2018.codfw.wmnet with OS bookworm [production]
22:02 <bking@cumin2003> END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host wdqs2026.codfw.wmnet with OS bookworm [production]
21:49 <bking@cumin2003> END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on wdqs2018.codfw.wmnet with reason: host reimage [production]
21:45 <bking@cumin2003> START - Cookbook sre.hosts.downtime for 2:00:00 on wdqs2018.codfw.wmnet with reason: host reimage [production]
21:38 <bking@cumin2003> END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on wdqs2026.codfw.wmnet with reason: host reimage [production]