FAS Research Computing - MGHPCC power work 5/21 - 5/23 - Some partitions will be at half capacity – Chi tiết bảo trì

Trải qua hiệu suất bị giảm sút một phần

Status page for the Harvard FAS Research Computing cluster and other resources.

Cluster Utilization (VPN and FASRC login required): Cannon | FASSE


Please scroll down to see details on any Incidents or maintenance notices.
Monthly maintenance occurs on the first Monday of the month (except holidays).

GETTING HELP
Documentation: https://docs.rc.fas.harvard.edu | Account Portal https://portal.rc.fas.harvard.edu
Email: rchelp@rc.fas.harvard.edu | Support Hours


The colors shown in the bars below were chosen to increase visibility for color-blind visitors.
For higher contrast, switch to light mode at the bottom of this page if the background is dark and colors are muted.

MGHPCC power work 5/21 - 5/23 - Some partitions will be at half capacity

Hoàn thành
Lên kế hoạch cho tháng 05 21, 2025 tại 11:00 – tháng 05 23, 2025 tại 19:00

Ảnh hưởng

Cannon Cluster

Đang bảo trì từ 11:00 AM đến 7:00 PM

SLURM Scheduler - Cannon

Đang bảo trì từ 11:00 AM đến 7:00 PM

Cannon Compute Cluster (Holyoke)

Đang bảo trì từ 11:00 AM đến 7:00 PM

Boston Compute Nodes

Đang bảo trì từ 11:00 AM đến 7:00 PM

GPU nodes (Holyoke)

Đang bảo trì từ 11:00 AM đến 7:00 PM

seas_compute

Đang bảo trì từ 11:00 AM đến 7:00 PM

Cập nhật
  • Hoàn thành
    tháng 05 23, 2025 tại 19:00
    Hoàn thành
    tháng 05 23, 2025 tại 19:00
    Maintenance has completed successfully
  • Đang tiến hành
    tháng 05 21, 2025 tại 11:00
    Đang tiến hành
    tháng 05 21, 2025 tại 11:00
    Maintenance is now in progress
  • Chưa bắt đầu
    tháng 05 21, 2025 tại 11:00
    Chưa bắt đầu
    tháng 05 21, 2025 tại 11:00

    The MGHPCC Holyoke data center will be performing power work on May 21st -23rd. This work will take out one half (or one 'side') of the power capacity for certain rows/racks including our compute rows. Because of our power draw, one side is not enough power to keep each full rack running.

    As such, we will be adding a reservation to idle half the nodes in the partitions listed below. A reservation will cause nodes to drain as jobs complete and stop scheduling new jobs on those nodes if they cannot be completed before the outage. This will allow us to idle and power down those nodes prior to the work and avoid potential blackout/brownout on those racks.

    This will mean that these partitions will be up and available, but that half the nodes from each will be down (assuming an even number of nodes).

    This work is part of an on-going power capacity upgrade at MGHPCC. We expect this will be the last power work needed and the facility will then provide enough additional power for future expansion as well adding overhead for the current load.

    The affected partitions are:

    • arguelles_delgado

    • bigmem_intermediate

    • blackhole_gpu

    • eddy gershman

    • hejazi

    • hernquist

    • hoekstra

    • huce_ice

    • iaifi_gpu

    • iaifi_gpu_requeue

    • iaifi_priority

    • jshapiro

    • jshapiro_priority

    • kempner

    • kempner_requeue

    • kempner_h100

    • kempner_h100_priority

    • kempner_h100_priority2

    • kovac kozinsky

    • kozinsky_gpu

    • kozinsky_requeue

    • ortegahernandez_ice

    • rivas

    • seas_compute

    • seas_gpu

    • siag_combo

    • siag_gpu

    • sur

    • zhuang