هیچ مدیر سایت یا کسبوکاری دوست نداره یک روز وارد سایتش بشه و ببینه همه چیز از دسترس خارج شده.
Downtime سرور میتونه باعث از دست رفتن مشتری، کاهش فروش، نارضایتی کاربران و حتی آسیب دیدن اعتبار یک کسبوکار بشه.
بعضی وقتها هم مشکل فقط چند دقیقه طول میکشه، اما همین چند دقیقه برای یک فروشگاه اینترنتی یا سرویس آنلاین میتونه هزینه زیادی داشته باشه.
خبر خوب اینه که خیلی از مشکلاتی که باعث قطعی سرور میشن، با بررسی و نگهداری منظم قابل پیشگیری هستن.
درست مثل خودرو که برای جلوگیری از خرابی ناگهانی نیاز به سرویس دورهای داره، سرور هم باید به صورت مرتب بررسی بشه.
در این مقاله میخوایم یک چکلیست کاربردی برای نگهداری ماهانه سرور بررسی کنیم تا با انجام چند کار مهم، احتمال بروز مشکل و جلوگیری از Downtime سرور رو تا حد زیادی افزایش بدید.
فهرست موضوعات:
- اهمیت نگهداری ماهانه سرور
- بررسی CPU و RAM
- جلوگیری از پر شدن دیسک
- بررسی وضعیت بکاپها
- بررسی آپدیتهای OS و نرمافزار
- لاگهای سرور
- بررسی سلامت سرویسهای مهم
- وضعیت امنیتی سرور
- مانیتورینگ و هشدارها
- عملکرد دیتابیس
- تاریخ انقضای SSL و دامنه
- ریبوت و وضع کلی سرور
- نتیجهگیری
- سوالات متداول

اهمیت نگهداری ماهانه سرور
سرورها معمولا به صورت 24 ساعته کار میکنن. سایت، دیتابیس، ایمیل، اپلیکیشن و سرویسهای مختلف ممکنه همگی روی یک سرور در حال اجرا باشن.
به همین دلیل، یک مشکل کوچک که در ابتدا جدی به نظر نمیرسه، ممکنه به مرور بزرگ بشه و در نهایت باعث اختلال یا قطعی کامل سرویس بشه.
مثلا ممکنه فضای دیسک سرور به مرور پر بشه، اما کسی متوجه نشه. لاگها هر روز حجم بیشتری بگیرن و بکاپها هم روی همان دیسک ذخیره بشن.
در نهایت یک روز فضای دیسک کاملا پر میشه و دیتابیس یا سرویسهای مهم دیگه نمیتونن اطلاعات جدیدی بنویسن. نتیجه؟ سایت یا برنامه از دسترس خارج میشه.
نگهداری ماهانه کمک میکنه این مشکلات قبل از اینکه به بحران تبدیل بشن، شناسایی و برطرف بشن.
بررسی CPU و RAM
یکی از اولین مواردی که باید هر ماه بررسی کنید، میزان مصرف CPU و RAM سروره.
مصرف بالای منابع همیشه به معنی وجود مشکل نیست. مثلا ممکنه سایت شما بازدید زیادی داشته باشه و طبیعی باشه که CPU بیشتر درگیر بشه.
اما اگر مصرف منابع برای مدت طولانی نزدیک به حداکثر باقی بمونه، باید علتش بررسی بشه.
مصرف زیاد CPU میتونه به دلایل مختلفی اتفاق بیفته.
یک افزونه مشکلدار در وردپرس، پردازشهای سنگین دیتابیس، حملات رباتی، اسکریپتهای اشتباه یا حتی بدافزار میتونن باعث افزایش مصرف CPU بشن.
در مورد RAM هم همین موضوع وجود داره. اگر حافظه سرور همیشه نزدیک به حداکثر ظرفیت باشه، سیستم ممکنه مجبور بشه از Swap استفاده کنه و سرعت سرور کاهش پیدا کنه.
مثلا فرض کنید یک VPS با 4 گیگابایت RAM دارید.
اگر معمولا مصرف RAM حدود 2 گیگابایت باشه اما ناگهان برای چند هفته به 3.9 گیگابایت برسه، بهتره بررسی کنید چه سرویس یا برنامهای باعث این افزایش شده.
بررسی منظم مصرف منابع از مهمترین بخشهای جلوگیری از Downtime سرور محسوب میشه.
جلوگیری از پر شدن دیسک
پر شدن فضای دیسک یکی از مشکلات رایج و در عین حال خطرناک سرورهاست.
خیلی از مدیران سرور فقط زمانی متوجه این موضوع میشن که سایت یا دیتابیس دچار مشکل شده. در حالی که با بررسی ماهانه فضای دیسک میشه قبل از رسیدن به وضعیت بحرانی، مشکل رو برطرف کرد.
مواردی مثل فایلهای لاگ، بکاپهای قدیمی، فایلهای موقت، کش برنامهها و فایلهای اضافی معمولا به مرور فضای زیادی اشغال میکنن.
بهتره بررسی کنید کدام پوشهها بیشترین حجم را مصرف میکنن و آیا همه فایلهای موجود واقعا مورد نیاز هستن یا نه.
مثلا ممکنه متوجه بشید پوشه لاگ یک سرویس بیش از 50 گیگابایت فضا گرفته. اگر این فایلها بدون مدیریت باقی بمونن، در آینده ممکنه کل فضای دیسک پر بشه.
بهتره همیشه مقداری فضای خالی برای شرایط اضطراری باقی بمونه و اجازه ندید دیسک سرور تا مرز پر شدن پیش بره.
بررسی وضعیت بکاپها
داشتن بکاپ به تنهایی کافی نیست. یکی از اشتباهات رایج اینه که مدیر سرور تصور میکنه چون سیستم بکاپ فعال شده، همه چیز امنه.
اما باید مطمئن بشید بکاپ واقعا به درستی ساخته میشه.
هر ماه بررسی کنید که بکاپها در زمان مشخص ایجاد میشن، حجم فایلها منطقیه و امکان بازیابی اطلاعات وجود داره.
گاهی یک سیستم بکاپ به دلیل کمبود فضای دیسک یا مشکل دسترسی، چند هفته است که خطا میده اما کسی متوجه نشده.
بهتره در فواصل زمانی مشخص، یکی از بکاپها رو در یک محیط تست بررسی کنید تا مطمئن بشید اطلاعات واقعا قابل بازیابی هستن.
برای مثال، اگر هر شب از دیتابیس سایت بکاپ گرفته میشه، فقط وجود فایل بکاپ کافی نیست.
بهتره یک بار فایل رو Restore کنید و مطمئن بشید دیتابیس بدون مشکل بازسازی میشه.
این موضوع در زمان بروز خرابی میتونه تفاوت بین چند دقیقه اختلال و چند روز از دست رفتن سرویس باشه.

بررسی آپدیتهای OS و نرمافزار
نرمافزارهای قدیمی فقط از نظر امنیتی خطرناک نیستن، بلکه ممکنه باعث بروز مشکلات عملکردی و ناسازگاری هم بشن.
هر ماه بررسی کنید که آیا آپدیت مهمی برای سیستمعامل، وبسرور، دیتابیس یا نرمافزارهای مورد استفاده منتشر شده یا نه.
البته این به معنی نصب فوری هر آپدیتی روی سرور اصلی نیست. بعضی آپدیتها ممکنه با نرمافزارهای فعلی سازگار نباشن.
اگر سرور حساسی دارید، بهتره ابتدا آپدیتها رو در محیط تست بررسی کنید و بعد روی سرور اصلی اعمال کنید.
همچنین بعد از هر آپدیت مهم، وضعیت سرویسهای اصلی رو بررسی کنید تا مطمئن بشید همه چیز به درستی کار میکنه.
لاگهای سرور
لاگها یکی از بهترین منابع برای پیدا کردن مشکلات پنهان هستن.
ممکنه سایت هنوز کاملا در دسترس باشه، اما داخل لاگها صدها خطای مربوط به دیتابیس، PHP، وبسرور یا سرویسهای دیگه ثبت شده باشه.
اگر این خطاها نادیده گرفته بشن، ممکنه در آینده باعث کندی یا قطعی سرویس بشن.
لازم نیست هر خط لاگ رو به صورت دستی بخونید، اما بهتره به دنبال خطاهای تکراری و غیرعادی باشید.
برای مثال، اگر یک سرویس هر چند دقیقه یک بار Restart میشه یا اتصال دیتابیس دائما قطع میشه، معمولا این موضوع در لاگها قابل مشاهده است.
بررسی ماهانه لاگها باعث میشه مشکلات رو قبل از اینکه کاربران متوجه بشن، شناسایی کنید.
بررسی سلامت سرویسهای مهم
روی هر سرور معمولا چند سرویس اصلی وجود داره که قطعی هر کدام میتونه باعث اختلال در سایت یا برنامه بشه.
بسته به نوع سرور، این سرویسها ممکنه شامل وبسرور، دیتابیس، سرویس ایمیل، DNS یا سرویسهای اختصاصی برنامه شما باشن.
هر ماه بررسی کنید که سرویسها بدون خطا اجرا میشن و Restart غیرعادی ندارن.
همچنین بهتره بررسی کنید بعد از ریبوت سرور، سرویسهای مهم به صورت خودکار اجرا میشن یا نه.
این مورد خیلی مهمه، چون ممکنه سرور به دلیل یک آپدیت یا مشکل سختافزاری ریبوت بشه، اما وبسرور یا دیتابیس بعد از بالا آمدن سیستم به صورت خودکار اجرا نشه.
وضعیت امنیتی سرور
امنیت هم ارتباط مستقیمی با پایداری سرور داره.
یک سرور آلوده یا هکشده ممکنه به شدت کند بشه، منابع زیادی مصرف کنه یا حتی کاملا از دسترس خارج بشه.
هر ماه بهتره وضعیت کاربران سرور، دسترسیهای SSH، فایروال و سرویسهای فعال رو بررسی کنید.
اگر کاربری دیگر به سرور دسترسی نیاز نداره، بهتره دسترسی اون حذف یا محدود بشه. همچنین بررسی کنید پورتهای غیرضروری باز نباشن.
تلاشهای ناموفق زیاد برای ورود به سرور هم میتونه نشانه حملات Brute Force باشه. ابزارهایی مثل Fail2Ban میتونن در محدود کردن چنین حملاتی کمک زیادی کنن.
بخش مهمی از جلوگیری از Downtime سرور، جلوگیری از مشکلات امنیتیه که ممکنه عملکرد کل سیستم رو مختل کنن.

مانیتورینگ و هشدارها
یکی از بهترین کارها برای مدیریت سرور اینه که منتظر تماس مشتری یا کاربر نباشید تا متوجه مشکل بشید.
سیستم مانیتورینگ باید قبل از اینکه وضعیت بحرانی بشه، به شما هشدار بده.
مثلا میتونید برای موارد زیر هشدار تنظیم کنید:
- افزایش غیرعادی مصرف CPU
- مصرف بالای RAM
- پر شدن فضای دیسک
- Down شدن سایت یا سرویس
- افزایش Load Average
- قطع شدن دیتابیس
- افزایش زمان پاسخ سایت
فرض کنید فضای دیسک سرور به 85 درصد رسیده. اگر همان لحظه هشدار دریافت کنید، فرصت دارید مشکل رو بررسی کنید.
اما اگر هیچ مانیتورینگی نداشته باشید، ممکنه زمانی متوجه بشید که دیسک کاملا پر شده و سایت از دسترس خارج شده.
عملکرد دیتابیس
دیتابیس یکی از حساسترین بخشهای بسیاری از سایتها و اپلیکیشنهاست.
اگر سایت شما از MySQL، MariaDB یا PostgreSQL استفاده میکنه، بهتره وضعیت دیتابیس رو به صورت دورهای بررسی کنید.
کوئریهای کند، تعداد زیاد اتصالها و مصرف بالای منابع توسط دیتابیس میتونه باعث کاهش سرعت کل سرویس بشه.
مثلا ممکنه یک افزونه یا بخش از برنامه، یک کوئری سنگین رو بارها اجرا کنه. در ابتدا شاید مشکل خاصی ایجاد نکنه، اما با افزایش کاربران سایت، فشار زیادی روی دیتابیس وارد میکنه.
بررسی Slow Queryها و وضعیت اتصالهای دیتابیس میتونه مشکلات آینده رو زودتر مشخص کنه.
تاریخ انقضای SSL و دامنه
گاهی Downtime اصلا به دلیل خرابی سختافزار یا مشکل نرمافزاری نیست.
ممکنه دامنه تمدید نشده باشه یا گواهی SSL منقضی شده باشه.
بهتره هر ماه تاریخ انقضای دامنهها و SSLها رو بررسی کنید. البته فعال کردن تمدید خودکار و هشدارهای ایمیلی هم کمک زیادی میکنه.
اگر SSL منقضی بشه، کاربران ممکنه با خطای امنیتی در مرورگر مواجه بشن و تصور کنن سایت مشکل جدی داره.
این موارد ساده هستن، اما نادیده گرفتن اونها میتونه باعث اختلال جدی در دسترسی کاربران بشه.

ریبوت و وضع کلی سرور
گاهی لازم نیست سرور رو بیدلیل ریبوت کنید، اما بهتره بدانید آخرین بار چه زمانی ریبوت شده و آیا بعد از ریبوت همه سرویسها به درستی بالا میان یا نه.
همچنین بررسی کنید آیا در لاگها خطاهای مربوط به Kernel، حافظه، دیسک یا سختافزار وجود داره.
اگر سرور شما فیزیکی هست، بررسی سلامت سختافزار اهمیت بیشتری پیدا میکنه. وضعیت RAID، سلامت هاردها، دمای سیستم و خطاهای سختافزاری باید به صورت دورهای بررسی بشن.
در سرورهای مجازی هم باید به وضعیت منابع اختصاص داده شده و عملکرد کلی VPS توجه کنید.
مثال: به فرض شما یک فروشگاه اینترنتی دارید که روی یک VPS اجرا میشه. در بررسی ماهانه متوجه میشید فضای دیسک از 60 درصد به 88 درصد رسیده.
با بررسی بیشتر مشخص میشه فایلهای لاگ وبسرور حجم زیادی پیدا کردن. در همان زمان فایلهای اضافی رو مدیریت میکنید و تنظیمات Log Rotation رو بررسی میکنید.
اگر این بررسی انجام نمیشد، احتمالا چند هفته بعد فضای دیسک کاملا پر میشد. در این شرایط دیتابیس ممکن بود نتونه اطلاعات جدید ثبت کنه و سایت با خطا مواجه بشه.
در واقع یک بررسی ساده ماهانه تونسته از یک قطعی احتمالی جلوگیری کنه.
برای اینکه چیزی رو فراموش نکنید، میتونید هر ماه این موارد رو بررسی کنید:
- مصرف CPU و RAM
- فضای خالی دیسک
- وضعیت بکاپها و تست بازیابی
- آپدیتهای سیستمعامل و نرمافزارها
- خطاهای مهم در لاگها
- وضعیت وبسرور و دیتابیس
- سلامت سرویسهای اصلی
- وضعیت فایروال و دسترسیها
- تنظیمات مانیتورینگ و هشدار
- تاریخ انقضای SSL و دامنه
- وضعیت کلی سختافزار یا منابع VPS
لازم نیست همه این کارها ساعتها زمان ببره. اگر مانیتورینگ و سیستم مدیریت مناسبی داشته باشید، بخش زیادی از این بررسیها سریع انجام میشه.
نتیجهگیری
Downtime همیشه قابل پیشبینی نیست، اما بخش زیادی از مشکلاتی که باعث قطعی سرور میشن، قبل از رسیدن به مرحله بحرانی نشانههایی دارن.
پر شدن دیسک، افزایش مصرف منابع، خطاهای تکراری در لاگها، بکاپهای خراب و مشکلات امنیتی معمولا یکشبه اتفاق نمیفتن.
این مشکلات به مرور ایجاد میشن و اگر به صورت منظم بررسی بشن، فرصت کافی برای برطرف کردن اونها وجود داره.
داشتن یک برنامه مشخص برای نگهداری ماهانه، یکی از بهترین روشها برای جلوگیری از Downtime سرور هست.
لازم نیست همیشه منتظر بروز مشکل باشید؛ بهتره هر ماه وضعیت سرور رو بررسی کنید و مشکلات کوچک رو قبل از اینکه به یک قطعی بزرگ تبدیل بشن، برطرف کنید.
در نهایت، یک سرور پایدار فقط با سختافزار قدرتمند ساخته نمیشه. مانیتورینگ مناسب، بکاپ مطمئن، بررسی منابع و نگهداری منظم، نقش بسیار مهمی در پایداری سرویس شما دارن.
مقالات مرتبط:
- راهنمای کامل بکاپگیری و Disaster Recovery برای سرورها
- چگونه مصرف CPU و RAM سرور را کاهش دهیم؟
- ۱۰ ابزار ضروری برای مدیریت و مانیتورینگ سرورها
سوالات متداول
آیا بررسی ماهانه سرور برای همه سرورها کافی است؟
برای بررسیهای کلی، ماهانه بودن مناسبه، اما بعضی موارد مثل مصرف CPU، RAM، فضای دیسک و در دسترس بودن سایت باید به صورت روزانه یا لحظهای مانیتور بشن.
مهمترین کار برای جلوگیری از Downtime سرور چیست؟
نمیشه فقط یک مورد رو مهمترین عامل دونست، اما داشتن مانیتورینگ مناسب و بکاپ قابل اعتماد تاثیر بسیار زیادی در کاهش خسارت و جلوگیری از قطعیهای طولانی داره.
آیا پر شدن فضای دیسک میتواند باعث Down شدن سایت شود؟
بله. وقتی فضای دیسک کاملا پر بشه، دیتابیس و سرویسهای مختلف ممکنه نتونن اطلاعات جدید بنویسن و سایت با خطا یا قطعی مواجه بشه.
هر چند وقت یک بار باید بکاپها را تست کنیم؟
بهتره به صورت دورهای و حداقل هر چند ماه یک بار فرآیند Restore رو تست کنید تا مطمئن بشید بکاپها واقعا قابل استفاده هستن.
آیا آپدیت کردن سرور همیشه باعث افزایش پایداری میشود؟
آپدیتها معمولا برای رفع مشکلات و آسیبپذیریها منتشر میشن، اما بهتره قبل از نصب روی سرورهای حساس، سازگاری اونها بررسی بشه. بعضی آپدیتها ممکنه نیاز به تست داشته باشن.
آیا مانیتورینگ میتواند به جلوگیری از Downtime کمک کند؟
بله، مانیتورینگ باعث میشه مشکلاتی مثل مصرف بالای منابع، پر شدن دیسک یا Down شدن سرویسها سریعتر شناسایی بشن و قبل از تبدیل شدن به یک مشکل بزرگ، برای رفع اونها اقدام کنید.
























