فصلِ 8

مدیریتِ خطا و پایداری

گردش‌کارِ آماتور وقتی چیزی خراب شود، بی‌صدا می‌میرد. گردش‌کارِ حرفه‌ای می‌داند چه کند.


۱

تلاشِ مجدد و ادامه‌بر‌خطا

دو تنظیمِ سطحِ نود که اولین خطِ دفاع‌اند.

در تبِ Settings هر نود دو گزینهٔ مهم هست: Retry On Fail (چند بار با فاصله دوباره تلاش کن — عالی برای خطاهای گذرای شبکه) و Continue On Fail (اگر این نود خطا داد، به‌جای توقفِ کل، با خروجیِ خطا ادامه بده). ترکیبشان بیشترِ خرابی‌های زودگذر را بی‌سروصدا جبران می‌کند.

۲

گردش‌کارِ خطا

یک شبکهٔ ایمنیِ سراسری برای وقتی چیزی واقعاً می‌شکند.

یک گردش‌کارِ جدا بساز که با نودِ Error Trigger شروع می‌شود. بعد در تنظیماتِ هر گردش‌کارِ اصلی، این را به‌عنوانِ Error Workflow انتخاب کن. حالا هر بار که آن گردش‌کار شکست بخورد، این خطاگیر خودکار اجرا می‌شود و می‌تواند به تلگرام یا ایمیل هشدار بفرستد — با جزئیاتِ اینکه کدام نود و چرا شکست.

// داده‌ای که Error Trigger می‌گیرد
{
  workflow: { name: "..." },
  execution: { error: { message, node } }
}
۳

توقفِ عمدی و اعتبارسنجی

گاهی باید خودت خطا بسازی.

نودِ Stop And Error عمداً گردش‌کار را با پیامی که خودت می‌نویسی متوقف می‌کند — برای وقتی داده معتبر نیست و نباید ادامه بدهی. الگوی خوب: اولِ گردش‌کار داده را با IF اعتبارسنجی کن؛ اگر خراب بود، Stop And Error با پیامِ روشن، تا در تاریخچهٔ اجرا دقیقاً بدانی چه شد.

۴

ذهنیتِ پایداری

این سؤال را از هر گردش‌کار بپرس: اگر این سرویس الان قطع باشد، یا این فیلد خالی بیاید، چه اتفاقی می‌افتد؟ اگر جواب «نمی‌دانم» است، هنوز آماده نیست.— اصلِ ساختِ سیستمِ قابل‌اعتماد