چک لیست نگهداری سرور؛ 10 اقدام ضروری برای افزایش طول عمر سرورهای HPE
نگهداری سرور یکی از مهمترین اقداماتی است که میتواند از بروز خرابیهای ناگهانی، کاهش عملکرد سیستمها و از دست رفتن اطلاعات جلوگیری کند. بسیاری از سازمانها و کسبوکارها سرمایهگذاری قابل توجهی روی زیرساختهای فناوری اطلاعات انجام میدهند، اما در صورت نداشتن برنامه منظم برای تعمیر و نگهداری سرور، این سرمایهگذاری میتواند با مشکلات جدی مواجه شود.
سرورهای HPE ProLiant نسبت به بسیاری از برندهای دیگر یک مزیت مهم دارند؛ ابزارهای مدیریتی داخلی مثل iLO و Smart Storage Administrator که نگهداری روتین را بسیار سادهتر میکنند. در این مقاله علاوه بر 10 نکته کلی نگهداری سرور، نشان میدهیم دقیقا با کدام ابزار HPE هر مرحله را انجام دهید.
طبق مستندات رسمی HPE، بخش بزرگی از رخدادهای خرابی سختافزاری سرور با بهروزرسانی منظم فریمور و درایور از طریق Service Pack for ProLiant قابل پیشگیری است، پیش از آنکه به قطعی کامل سرویس منجر شود.
1. به صورت منظم از اطلاعات سرور نسخه پشتیبان تهیه کنید
تهیه نسخه پشتیبان یا Backup مهمترین اقدام در نگهداری سرور محسوب میشود. خرابی سختافزار، حملات باجافزاری، حذف ناخواسته اطلاعات یا مشکلات نرمافزاری میتوانند باعث از دست رفتن دادههای ارزشمند شوند. در چنین شرایطی تنها راه بازگردانی اطلاعات، استفاده از نسخههای پشتیبان سالم و بهروز خواهد بود.
پیشنهاد میشود فرآیند پشتیبانگیری به صورت خودکار انجام شود و نسخههای پشتیبان در چند محل مختلف ذخیره شوند. استفاده از قانون 3-2-1 یکی از بهترین روشها برای محافظت از اطلاعات است؛ به این معنا که حداقل سه نسخه از دادهها داشته باشید، آنها را روی دو نوع فضای ذخیرهسازی مختلف نگهداری کنید و یک نسخه را خارج از محل اصلی یا در فضای ابری ذخیره نمایید.
2. از سالم بودن نسخههای پشتیبان اطمینان حاصل کنید
تهیه نسخه پشتیبان به تنهایی کافی نیست. بسیاری از مدیران شبکه زمانی متوجه مشکل میشوند که در زمان بازیابی اطلاعات، فایلهای بکاپ ناقص یا خراب هستند. به همین دلیل لازم است نسخههای پشتیبان به صورت دورهای مورد آزمایش قرار گیرند.
حداقل هفتهای یک بار یکی از نسخههای پشتیبان را روی یک محیط آزمایشی بازیابی کنید. این کار باعث میشود از صحت فرآیند بازیابی، سالم بودن فایلها و امکان بازگردانی کامل اطلاعات اطمینان حاصل شود.
3. گزارشهای مانیتورینگ سرور را روزانه بررسی کنید
مانیتورینگ مداوم سرور یکی از مهمترین بخشهای نگهداری زیرساختهای فناوری اطلاعات است. در سرورهای HPE ProLiant، رابط مدیریتی iLO (Integrated Lights-Out) این کار را بدون نیاز به حضور فیزیکی یا حتی روشن بودن سیستمعامل انجام میدهد؛ از داشبورد iLO میتوانید وضعیت پردازنده، حافظه، فنها، منبع تغذیه و دمای داخلی سرور را به صورت لحظهای مشاهده کنید.
بررسی روزانه گزارشهای iLO Event Log و تنظیم هشدارهای خودکار (iLO Alerts) باعث میشود مشکلات احتمالی پیش از تبدیل شدن به اختلالات جدی شناسایی شوند. افزایش غیرعادی مصرف CPU، کمبود حافظه RAM یا افزایش تعداد خطاهای سیستم میتواند نشانهای از وجود مشکلات سختافزاری باشد که باید در کوتاهترین زمان ممکن بررسی شوند.
4. وضعیت فضای ذخیرهسازی و آرایههای RAID را کنترل کنید
کمبود فضای ذخیرهسازی یکی از دلایل رایج بروز اختلال در سرورها است. زمانی که فضای دیسک به ظرفیت نهایی خود نزدیک میشود، عملکرد پایگاههای داده کاهش پیدا میکند و بسیاری از سرویسها با خطا مواجه میشوند.
در سرورهای HPE، ابزار HPE Smart Storage Administrator (SSA) امکان بررسی سلامت دیسکها، وضعیت آرایههای RAID و باتری کنترلر ذخیرهسازی را در یک محیط گرافیکی فراهم میکند. بهتر است میزان فضای آزاد هارد دیسکها به صورت مستمر بررسی شود و برای رسیدن ظرفیت ذخیرهسازی به سطوح بحرانی هشدارهای خودکار تعریف گردد.
برای ارتقاء زیرساخت سازمانی خود میتوانید از راهنمایی کارشناسان رسام سرور استفاده کنید:
5. ابزارهای مدیریت از راه دور را بررسی و آزمایش کنید
در بسیاری از مواقع مدیران شبکه امکان حضور فیزیکی در محل سرور را ندارند و باید از طریق ابزارهای مدیریت از راه دور به تجهیزات دسترسی پیدا کنند. iLO Remote Console این امکان را میدهد که حتی در صورت خاموش بودن سرور یا خرابی سیستمعامل، از راه دور به کنسول سرور متصل شوید، مدیا مجازی (Virtual Media) نصب کنید یا سرور را ریاستارت کنید.
سرویسهای Remote Desktop، VPN و پنلهای مدیریتی نیز باید به صورت دورهای آزمایش شوند. عدم دسترسی به این ابزارها در زمان وقوع بحران میتواند فرآیند رفع مشکل را با تأخیر مواجه کند.
6. دما و رطوبت اتاق سرور را کنترل کنید
شرایط محیطی نامناسب میتواند تأثیر مستقیمی بر عملکرد و طول عمر تجهیزات داشته باشد. افزایش بیش از حد دما موجب استهلاک سریعتر قطعات، افزایش مصرف انرژی و کاهش پایداری سیستم میشود.
علاوه بر سیستمهای تهویه اتاق سرور، سنسورهای دمای داخلی iLO (Ambient Temperature) هشدار میدهند اگر دمای ورودی هوا به سرور از محدوده امن خارج شود. دمای پیشنهادی معمولا بین 18 تا 27 درجه سانتیگراد است.
7. اتاق سرور و تجهیزات را به صورت منظم تمیز کنید
گرد و غبار یکی از عوامل اصلی افزایش دمای تجهیزات و کاهش راندمان سیستمهای خنککننده است. تجمع آلودگی روی فنها، رکها و تجهیزات شبکه میتواند جریان هوا را مختل کرده و باعث افزایش احتمال خرابی قطعات شود. بهتر است اتاق سرور به صورت منظم پاکسازی شود و از تجهیزات مناسب برای نظافت محیط استفاده گردد.
8. سلامت سختافزار سرور را بررسی کنید
بسیاری از مشکلات سرورها به خرابی تدریجی قطعات سختافزاری مربوط میشوند. صفحه System Health در iLO و LEDهای وضعیت روی شاسی سرور، سریعترین راه برای تشخیص خرابی هارد دیسک، فن یا منبع تغذیه هستند. ترکیب گزارش iLO با HPE Smart Storage Administrator باعث میشود در صورت بروز خطا، هشدارهای لازم پیش از خرابی کامل قطعه در اختیار مدیر شبکه قرار گیرد.
9. حسابهای کاربری و سطح دسترسی کاربران را مدیریت کنید
یکی از مهمترین بخشهای امنیت سرور، مدیریت کاربران و سطح دسترسی آنها است. حسابهای کاربری قدیمی یا دسترسیهای بیش از حد میتوانند ریسکهای امنیتی قابل توجهی ایجاد کنند. در iLO میتوانید برای هر کاربر سطح دسترسی جداگانه (Administrator، Remote Console، Virtual Media و…) تعریف کنید تا دسترسی افراد دقیقا محدود به وظیفهشان باشد.
بهتر است به صورت دورهای تمامی حسابهای کاربری بررسی شوند و دسترسی افراد غیرضروری حذف گردد. استفاده از رمزهای عبور قوی و احراز هویت چندمرحلهای نیز سطح امنیت سرور را به میزان قابل توجهی افزایش میدهد.
10. سیستم عامل، فریمور و درایورهای سرور را بهروز نگه دارید
بهروزرسانیهای نرمافزاری تنها برای اضافه شدن قابلیتهای جدید منتشر نمیشوند، بلکه بخش بزرگی از آنها مربوط به رفع آسیبپذیریهای امنیتی و ناسازگاریهای سختافزاری هستند. برای سرورهای HPE ProLiant، بسته Service Pack for ProLiant (SPP) مجموعه کاملی از فریمور، درایور و ابزارهای مدیریتی را در یک ایمیج واحد ارائه میدهد و از طریق Smart Update Manager (SUM) به صورت خودکار روی سرور اعمال میشود.
بهتر است پیش از هر بهروزرسانی مهم، ابتدا فریمور iLO و BIOS بهروز شوند و سپس سایر درایورها اعمال گردند. همچنین پیش از انجام بهروزرسانیهای مهم، تهیه نسخه پشتیبان کامل ضروری است.
جدول زمانبندی پیشنهادی نگهداری سرور
| اقدام | بازه زمانی |
|---|---|
| بررسی گزارش iLO و مانیتورینگ منابع | روزانه |
| بررسی وضعیت بکاپ و لاگها | روزانه |
| تست بازیابی نسخه پشتیبان | هفتگی |
| بررسی سلامت دیسک و RAID با SSA | هفتگی |
| پاکسازی فضای ذخیرهسازی | ماهانه |
| بازبینی حسابهای کاربری و دسترسیها | ماهانه |
| نظافت فیزیکی اتاق سرور و تجهیزات | ماهانه |
| بهروزرسانی فریمور و درایور با SPP/SUM | فصلی |
جمعبندی
نگهداری سرور یک فعالیت مستمر و برنامهریزی شده است که نقش مهمی در افزایش پایداری سرویسها، حفظ امنیت اطلاعات و کاهش هزینههای عملیاتی دارد. در سرورهای HPE ProLiant، ابزارهای داخلی مثل iLO، Smart Storage Administrator و Service Pack for ProLiant بخش زیادی از این فرآیند را سادهتر و قابل اتوماسیون میکنند. سازمانهایی که از این ابزارها به همراه یک برنامه منظم استفاده میکنند، معمولا با خرابیهای کمتر و عملکرد پایدارتری مواجه میشوند.
سوالات متداول نکات نگهداری سرور فیزیکی
نگهداری سرور هر چند وقت یکبار باید انجام شود؟
برخی فعالیتها مانند بررسی بکاپ، لاگها و گزارش iLO باید روزانه انجام شوند، در حالی که بررسی سختافزار و پاکسازی تجهیزات میتواند هفتگی یا ماهانه انجام شود.
مهمترین بخش نگهداری سرور چیست؟
تهیه نسخه پشتیبان منظم و اطمینان از امکان بازیابی اطلاعات مهمترین بخش نگهداری سرور محسوب میشود.
iLO چیست و چه نقشی در نگهداری سرور دارد؟
iLO رابط مدیریت از راه دور سرورهای HPE ProLiant است که امکان مانیتورینگ سختافزار، دسترسی به کنسول سرور و دریافت هشدار خرابی را حتی در صورت خاموش بودن سیستمعامل فراهم میکند.
دمای مناسب اتاق سرور چقدر است؟
به طور معمول دمای بین 18 تا 27 درجه سانتیگراد برای عملکرد مناسب تجهیزات سرور توصیه میشود.
با چه ابزاری فریمور و درایور سرورهای HPE بهروزرسانی میشود؟
بسته Service Pack for ProLiant (SPP) به همراه ابزار Smart Update Manager (SUM) روش رسمی HPE برای بهروزرسانی یکجای فریمور، درایور و نرمافزارهای سرور است.

