تجزیه و تحلیل شکست فرستنده گیرنده برای اپتیک 100G: جداسازی علت ریشه در QSFP28 و CFP

Jul 07, 2026|

Technical analysis of 100G QSFP28 and CFP optical transceiver modules in a data center environment

 

یک ماژول 100G که مدام تکان می خورد، یا ماژول کاملاً تاریک شده است، واقعاً یک مشکل "اپتیک خراب" نیست. این یک مشکل جداسازی است و تجزیه و تحلیل خرابی فرستنده گیرنده واقعاً در مورد آن جداسازی است. قبل از اینکه کسی بازگشتی را ارسال کند، باید به یک سؤال سخت‌تر پاسخ دهد: آیا خطا واقعاً در ماژول است یا کابل وصله، پورت میزبان، سیستم‌افزار پلتفرم، نحوه کار با قطعه، یا تقلبی که به عنوان یک مورد واجد شرایط پنهان شده است؟ یا تحقیر کننده100G QSFP28یا ماژول CFP، بین RMA و بازیابی تصمیم بگیرید و از بازگشت همان خطا به ناوگان در سه ماهه بعدی جلوگیری کنید.

 

بازیابی یک پیوند با دانستن دلیل خرابی آن یکسان نیست

مانیتورینگ تشخیصی دیجیتال ارزان‌ترین ابزار تشخیصی است که شما در حال حاضر دارید، و بیشتر مرگ یک ماژول چند روز قبل از قطع شدن پیوند در آن قابل خواندن است. چهار کانال سیگنال را حمل می‌کنند.انتقال قدرت نوریسقوط بیش از 3 دسی بل به زیر پنجره رتبه بندی آن نشانگر کلاسیک-پایان- عمر مسیر انتقال است. جریان بایاس لیزری که بیش از 20 درصد از خط پایه راه اندازی خود ماژول بالا می رود، لیزر برای حفظ همان خروجی سخت تر کار می کند. خزش آهسته و یکنواخت 15 تا 20 درصد در طول 12 تا 18 ماه، تخریب تدریجی کتاب درسی است، نه سر و صدا. دمای بدنه بالای 70 درجه پارک شده و ولتاژ منبع تغذیه خارج از ریل 3.135-3.465 V دور مجموعه هشدار اولیه DDM است. آن چهار را به صورت الف بخوانیدروندبه جای مقادیر گذر/شکست آنی، و خرابی جریان بایاس لیزر QSFP28 خود را خیلی زودتر از قطع اعلام می کند. این منطق روند دقیقاً مبنای تصمیم گیری استزمان بازنشستگی و ارتقاء ماژول های فرستنده گیرندهقبل از اینکه با آنها لینک بگیرند.

 

چیزی که بازخوانی DDM به خودی خود به شما نشان نمی دهد، ماژولی است که به راحتی در داخل هر آستانه هشدار قرار می گیرد و همچنان در حال مرگ است. آن کلاس شکست یک نام دارد، اکتشافی "بررسی DDM، سبز است، ماژول خوب است" را به طور کامل می شکند، و در میان تله های زیر، رفتار خاص خود را پیدا می کند.

Digital Diagnostic Monitoring DDM interface showing real-time laser bias current and optical power trends for 100G optics

 

شش حالت شکست و فیزیک پشت هر کدام

 

حالت شکست مکانیسم فیزیکی امضای اصلی DDM/فیلد چه چیزی در واقع پرونده را بسته است
فرسودگی تدریجی لیزر- افزایش آهسته جریان آستانه در طول عمر مفید قدرت TX رو به پایین است، بایاس 15 تا 20 درصد افزایش می یابد روند سوگیری/BER در مقابل خط پایه راه اندازی
آسیب آینه نوری فاجعه بار (COMD) تخریب ناگهانی وجه تحت بار نوری فروپاشی ناگهانی TX، بدون پیش‌روی تدریجی بازرسی وجهی؛ متمایز از فرسودگی-
فتودیود / تخریب ROSA کاهش پاسخگویی در مسیر دریافت توان RX طبیعی است اما قبل از{0}FEC BER در حال افزایش است جداسازی Loopback TX در مقابل RX
پیری حرارتی سایش تسریع شده از گرمای پایدار دمای بدنه ~70 درجه +، کاهش قدرت سریعتر بررسی حرارتی قفس / شکاف
آلودگی کانکتور از دست دادن درج غبار/روغن RX کم، TX معمولی، هر دو انتها "سالم" محدوده-و-پاک کردن، دوباره-اندازه گیری کنید
تقلبی / سیستم عامل EEPROM فیلدهای فروشنده جعلی، رفتار غیرقابل پیش بینی خطاهای متناوب، DDM سرکوب شد ممیزی EEPROM/فروشنده، همبستگی گزارش میزبان

 

دو تا از اینها به طور معمول با هم ترکیب می شوند. فرسودگی تدریجی-و COMD همان مرگ لیزری نیستند: فرسودگی-خزش بایاس آهسته بالا است، در حالی که COMD تخریب آنی وجه تحت بار نوری است، و رویکردهای جدیدتر{3}}یکپارچه سازی کمتر به طور خاص برای طراحی آن دنبال می‌شوند.نیمه هادی امروز). و آلودگی کانکتور یک حالت جزئی نیست که در انتهای لیست پنهان شود. یک مطالعه NTT-در فناوری پیشرفته نشان داد که آلودگی سطحی 96% از نصب کنندگان و 80% اپراتورهای شبکه را تحت تأثیر قرار داده است، به همین دلیل است که سازندگان تجهیزات آزمایشی، کانکتورهای کثیف را به عنوان شماره-یکی از علل خرابی فیبر{7}}شبکه رتبه بندی می کنند (EXFO). ماژولی که برای "Low RX" بازگردانده شده است که واقعاً یک کار تمیز کردن 5 دلاری بود، گران ترین مثبت کاذب در این رشته است. ما شاهد عرضه 200 ماژول مرکز داده‌ای بوده‌ایم که تله‌متری مانیتورینگ گمشده را به تقریباً 47000 دلار جایگزین و سه روز از کار افتادن تبدیل می‌کند.ویژگی های فرستنده و گیرنده شبکه.

 

درخت تصمیم: ماژول، فیبر، میزبان، پیکربندی - یا هندلینگ

 

تنها مهم ترین قانون در تجزیه و تحلیل علت اصلی ماژول نوری 100G رویه ای است، نه فنی:قبل از طبقه بندی جداسازی کنیدیک مقدار DDM یا یک خط syslog یک علامت را به شما می گوید. به شما نمی گوید که کدام دامنه صاحب خطا است. تعویض تست، لوپ بک، BERT و جایی که فاصله در جریان است،یک ردیابی OTDRابزارهایی هستند که یک علامت را به یک دامنه ایزوله تبدیل می کنند. ابتدا دامنه را ثابت کنید، سپس به مکانیسم برسید.

این سفارش بیشتر چیزی است که انجام تجزیه و تحلیل خرابی در یک QSFP28 در واقع به آن منتهی می شود. دامنه پنجمی وجود دارد که راهنماهای عیب یابی هرگز از آن نام نمی برند، زیرا هیچ کس از ثبت آن لذت نمی برد: مدیریت. ضربه ESD از یک درج غیر پایه، یک قفس بیش از-گشتاور یا بیش از حد-قرار داده شده، یک صفحه انتهایی تمیز نشده که با عجله جفت شده است، یک مرتبه بالا{5} اشتباه: اینها "شکست های ماژول" را ایجاد می کنند که واقعاً خرابی فرآیند است. واضح است: اگر یک خطای شناخته شده-در همان راه، با همان اشتباهات جایگزین، اشتباهات مشابه را دنبال می کند. رویه، نه قسمت نام بردن با صدای بلند این اتهام نیست. این تفاوت بین اصلاح یک گردش کار و ارسال یک ماژول سالم به عنوان یک آمار RMA است.

گردش کار یک -اندازه-براساس همه- نیست، و تظاهر به آن باعث بازدهی بدی می‌شود. سه سناریوی استقرار یک درخت را در جهات مختلف می کشند. تکان دادن یک ماژول در تولید یک مورد تمیز است: اپتیک مشکوک را به یک-پورت خوب و فیبر خوب شناخته شده-در هر بار یک متغیر منتقل کنید، و اگر خطا به دنبال ماژول باشد، دامنه خود را دارید. خرابی چندین ماژول در یک زمان، درست پس از یک پنجره تغییر، تقریباً هرگز به معنای یک دسته بد نیست. خرابی های مرتبط در یک نقطه مرزی تعمیر و نگهداری در میزبان یا پیکربندی، الگویی که بخش تله به آن باز می گردد. سناریوی سوم پاسخ صادقانه بهچرا فرستنده و گیرنده 100G من از کار افتاد؟هنگامی که هیچ چیز آشکاری از کار افتاد: تخریب متناوب با DDM سبز. هیچ‌کدام از تست‌های مبادله در اینجا فعال نمی‌شوند، زیرا هیچ عیب سختی برای گرفتن وجود ندارد. شما در طول ساعت‌ها BER و سوگیری را برخلاف خط مبنا دنبال می‌کنید تا زمانی که الگوی یک ماژول حاشیه‌ای را از یک فیبر حاشیه‌ای جدا کند. این سناریویی است که یک مبادله سریع میدان نمی تواند به تنهایی حل شود. بدون یک خط مبنا به کارگیری جهت مخالف، یا حذف نیمکت برای نظر دوم، یک تمایل عجولانه در اینجا باعث ایجاد بازگشت "هیچ عیب یافت نشد" می شود که مستقیماً به شما بازمی گردد.

 

تله هایی که مهندسان خوب RMA را به یک ماژول سالم تبدیل می کنند

 

این بخشی است که راهنماهای عیب یابی از آن صرف نظر می کنند و بیشتر تشخیص های اشتباه در آن زندگی می کنند. هر تله زیر یک ماژول کار را در یک جعبه بازگشت قرار داده است.

 

  • جریان بایاس لیزر صفر یک قرائت مبهم است، نه یک تشخیص.هنگامی که یک درایور لیزر یا مدار آن از کار می افتد، DDM می تواند جریان بایاس را صفر گزارش کندیابه عنوان حداکثر، و صفر می تواند به معنای یک لید لیزر باز باشد به همان راحتی که کوتاه است. برخورد با "تعصب=0، بنابراین لیزر مرده" دقیقاً همان-تک ارزشی است که در نیمکت FA ناموفق است. همان مدار یک لبه ایمنی را پنهان می کند: اگر حلقه بازخورد نظارت{4} پاره شود، درایور بایاس می تواند لیزر را به سمت حداکثر فشار دهد و خاموشی محافظ را در چند میکروثانیه از خطا (USPTO) خاموش کند. "ماژول سوخته-" در یادداشت های برگشتی شما ممکن است یک سفر محافظتی باشد که دقیقاً همانطور که طراحی شده است.
     
  • شکست خاکستری نقطه کور اکتشافی DDM است.یک ماژول می تواند از هر آستانه DDM پیکربندی شده عبور کند در حالی که پیوند بی سر و صدا زیر آلارم ها تخریب می شود. نظارت آستانه برای گرفتن گشت‌ها، نه تغییر روند آهسته در لایه فیزیکی ساخته شده است، بنابراین تخریب اولیه از دروازه عبور/خراب می‌گذرد، و صنعت همچنان فاقد تریاژ روند اولیه خوب برای این کلاس در لایه نوری (USPTO) است. اگر ناوگان{3}}داستان سلامتی شما "همه اپتیک سبز" است، خرابی های خاکستری دقیقاً جمعیتی هستند که نمی بینند.
     
  • سایه حرارتی خرابی های فانتوم را ایجاد می کند که به دنبال شکاف هستند، نه ماژول.در طرح‌های-به-قفس شکمی، ردیف بالایی پورت‌ها معمولاً 10 تا 15 درجه گرمتر از ردیف پایین‌تر به دلیل سایه‌های حرارتی است. اگر یک پورت ردیف بالا به خوردن ماژول‌ها ادامه می‌دهد، همان ماژول را به یک پورت ردیف پایین‌تر منتقل کنید و دوباره-آزمایش کنید. هنگامی که خطا روی شکاف باقی می ماند، در پوشیدن لباس شکست- ماژول مشکل خنک کننده دارید.
     
  • سفت‌افزار{0}}خطای راه‌اندازی-غیرفعال کردن سیلیکون مرده را جعل می‌کند.پس از بارگیری مجدد سوئیچ اصلی یا ارتقاء نرم افزار،پیوندهای شخص ثالث-می تواند از مذاکره انبوه امتناع کند، نه به این دلیل که اپتیک از بین رفته است، بلکه به این دلیل که دستگاه دولت میزبان آنها را رد کرده است. ماژول تغییر نکرده است. پیکربندی انجام شد. این مکانیزم پشت سناریوی "چندین خرابی همزمان پس از یک پنجره تغییر" در بالا است، و یک علت اصلی پیکربندی است، نه سخت افزاری.

 

چرا تجزیه و تحلیل خرابی CFP/CFP2 فقط QSFP28 در اندازه بزرگتر نیست

 

Side by side comparison of CFP2 and QSFP28 optical transceivers for 100G networking hardware failure analysis

 

تقریباً هر راهنمای موجود در بازار، «تحلیل خرابی فرستنده گیرنده» را مترادف با QSFP28 می‌داند، و حذف CFP بی‌ضرر نیست، زیرا تجزیه و تحلیل واقعاً متفاوت است. سطح مدیریت ابتدا از هم جدا می‌شود: ماژول‌های خانواده-CFP معمولاً از طریق MDIO مدیریت می‌شوند نه مدل CMIS که بر فاکتورهای شکل مدرن QSFP-DD/QSFP28 حاکم است، بنابراین ثبت‌های تشخیصی، وضعیت{5}}رفتار دستگاه و میزبان{6}}دست دادن طرف شما یکسان نیست. بعد اقتصاد از هم جدا می شود. یک ماژول منسجم CFP2 هزینه واحد بسیار بالاتری نسبت به یک سرویس گیرنده{10}}QSFP28 دارد که RMA{12}}در مقابل{13}}ریاضی بازیابی را به سختی به سمت مشتری تغییر می‌دهد.قبل از ضایعات تجزیه و تحلیل کنید.و نقش استقرار متفاوت است:-اپتیک های کلاس CFP در پیوندهایی منسجم و طولانی تر زندگی می کنند-که در آن جمعیت خرابی به سمت نوری{3}}مسیر و اثرات حرارتی منحرف می شود تا خطاهای اتصال{{4}و{5}}پیکربندی که بر روی پارچه های کوتاه غالب هستند{6}. تجزیه و تحلیل خرابی ماژول CFP که فقط از چک لیست QSFP28 دوباره استفاده می کند، هم رجیسترها و هم ریسک را اشتباه خوانده می شود. از آنجایی که اقتصاد واحد غیرقابل بخشش است، مورد مبهم CFP موردی است که در آن روند بر خلاف یک پایه واقعی، به جای حدس میدانی، سریع‌ترین هزینه را می‌پردازد.

 

استاندارد قابلیت اطمینان RMA شما ممکن است از سال 2004 باشد

 

وقتی تامین‌کننده‌ای می‌گوید که یک ماژول دارای "صلاحیت Telcordia" است، معمولاً به GR-468-CORE اشاره می‌کند، مشخصه-طولانی-تست قابلیت اطمینان و صلاحیت قطعات الکترونیکی نوری، که در حدود 25{10}سال انتظار خدمات ساخته شده است. فیزیک زیربنایی واقعی است: تحت شرایط معرف GR-468 (تقریباً 10 مگاوات، 80 درجه)، یک لیزر DFB یک زمان تا شکست در حدود 106 ساعت را حمل می‌کند، و صلاحیت مبتنی بر آزمایش‌های عمر عملیاتی در دمای بالا است که به شرایط صحرایی ترجمه شده است.رابطه آرنیوس. این اعداد واژگان قابلیت اطمینان هستند که آرگومان RMA در آن نوشته شده است.

 

گذراندن GR{4}}468 ضروری است اما دیگر کافی نیست. این مشخصات در سال 2004 تأیید شد و از آن زمان به‌طور معنی‌داری به‌روزرسانی نشده است و برای دنیای هرمتیک، NRZ نوشته شده است. این برای غربالگری حالت‌های خرابی که بسته‌بندی غیرهرمتیک، فوتونیک سیلیکونی و سیگنالینگ PAM4 معرفی می‌کنند ساخته نشده است، شکافی که کار قابلیت اطمینان 2025 صنعت صراحتاً آن را به‌عنوان ترک کردن قطعات حامل-در{10}}غیر{10}}غیره (IPEC) نامیده می‌شود. در حالی که ناوگان شما به سمت اپتیک سیلیکونی فوتونیک PAM4 حرکت کرده است، استاندارد بی‌صدا نمی‌تواند حالت‌های دقیقی را که جدیدترین ماژول‌های شما نشان می‌دهند نشان دهد. "واجد شرایط" نقطه شروعی برای تجزیه و تحلیل شکست است، نه پایان آن.

 

RMA یا reseat: برقراری تماس و جلوگیری از تماس بعدی

 

تصمیم در اسلات باینری است: ماژول را برگردانید یا آن را بازیابی کنید. بازیابی-و-بازیابی صحیح است زمانی که شواهد به بیرون اشاره می‌کنند: آلودگی که دامنه تأیید می‌کند، یک شکاف سایه حرارتی- که آزمایش جابجایی نشان می‌دهد، یک خطای میان‌افزار-غیرفعال کردن پنجره تغییر توضیح داده می‌شود، یک خطای مدیریتی که تکرار-تحت{{6}آزمون باز می‌شود. تجزیه و تحلیل RMA فرستنده گیرنده زمانی درست است که خطا از طریق تعویض و حلقه بک ماژول را دنبال کند، زمانی که بایاس و روند BER از خط پایه گذشته است، به نحوی که جابجایی نمی تواند توضیح دهد، یا زمانی که ممیزی EEPROM با شکست مواجه می شود. چیزی که هرگز درست نیست این است که قبل از انجام جداسازی، یک بار خواندن را کنار بگذارید، زیرا بازگشت "عیبی پیدا نشد" هزینه ای است که دو بار پرداخت می کنید.

 

جایی که این قانون کلی شکسته می‌شود، میانه مبهم است: یک روند سوگیری که با نتیجه مبادله در تضاد است، یا یک ممیزی EEPROM که بی‌نتیجه است. دقیقاً همان جایی است که یک چک لیست عمومی به شما یک پاسخ اشتباه مطمئن را می دهد، و جایی است که خرابی نیمکت یا حکم سازگاری به جای RMA اشتباه ارسال شده{1}} هزینه خود را به همراه دارد. این نکته ای است که باید پشتیبانی تحلیلی-در سطح شکست{4}} مهندسی را برایناوگان 100G QSFP28 و CFP.

 

جلوگیری از عود جایی است که تجزیه و تحلیل شکست دیگر واکنشی نیست و ما پول خود را در آنجا می گذاریم. در خط-QA ورودی خود، رایت کارخانه-را با تأیید ۱۰۰٪ DDM اجرا می‌کنیم و گزارش‌های آزمایشی هر- دسته را نگه می‌داریم، بنابراین خط پایه راه‌اندازی یک ماژول قبل از ارسال وجود دارد. این خط مبنا همان چیزی است که باعث می‌شود یک سوگیری بعدی-دریفت یا خاکستری-تماس شکست قابل اثبات به جای حدس زدن باشد، و چه چیزی تله‌های تقلبی-EEPROM و میان‌افزار-را از اسرار به رویدادهای ممیزی شده رد می‌کند. آن را با یک نسبت صرفه‌جویی واقعی و DDM جفت کنید.روندآلارم‌ها به‌جای آستانه{0}}فقط آلارم‌ها، و خرابی‌های خاکستری قبل از رها کردن پیوند به جای بعد، ظاهر می‌شوند.

 

سوالات متداول

س: تجزیه و تحلیل خرابی گیرنده نوری چیست و چه تفاوتی با عیب یابی دارد؟

A: عیب یابی یک پیوند را بازیابی می کند. تجزیه و تحلیل شکست، علت اصلی را تعیین می کند و با جداسازی خطا در ماژول، فیبر، پورت میزبان، پیکربندی یا مدیریت قبل از ثبت RMA از عود آن جلوگیری می کند.

س: کدام مقادیر DDM نشان می دهد که 100G QSFP28 خراب است؟

پاسخ: افت توان TX بیش از 3 دسی بل کمتر از مشخصات، جریان بایاس لیزر که بیش از حدود 20 درصد بالاتر از خط پایه راه اندازی می شود، دمای ثابت بالای 70 درجه و افزایش Pre{3}}FEC BER علائم اولیه هشدار پایان-- زندگی هستند.

س: تجزیه و تحلیل خرابی CFP/CFP2 چه تفاوتی با QSFP28 دارد؟

پاسخ: ماژول‌های خانواده-CFP از مدیریت مبتنی بر MDIO-به جای CMIS استفاده می‌کنند، در نقش‌های{2}}منسجم و طولانی{3}}با ارزش بالاتر اجرا می‌شوند و دارای اقتصاد RMA بسیار متفاوتی هستند، بنابراین هم ثبت‌های جداسازی و هم تصمیم جایگزینی متفاوت است.

س: ماژول من جریان بایاس لیزری صفر را نشان می‌دهد - آیا این نشان می‌دهد که خاموش است؟

پاسخ: خیر. خواندن صفر می‌تواند نشان‌دهنده یک لید لیزری باز یا اتصال کوتاه باشد، و یک حلقه برق{1} ناموفق می‌تواند باعث خاموش شدن محافظتی شود، بنابراین قبل از برگرداندن آن را با تست‌های برگشتی و تعویض آن تأیید کنید.

س: آیا عبور از تمام آستانه های DDM به معنای سالم بودن فرستنده است؟

پاسخ: خیر. خرابی‌های خاکستری یک پیوند را در حالی که در آستانه‌های هشدار باقی می‌مانند، تخریب می‌کنند، بنابراین به‌جای تکیه بر مقادیر عبور/خرابی یک- نقطه، جریان سوگیری روند و BER در طول زمان تغییر می‌کند.

 

بستن حلقه

 

یک ماژول 100G شکست خورده تنها تا زمانی که آن را از طریق یک دنباله تکرارپذیر اجرا نکنید مبهم است: روند DDM را بخوانید، حالت شکست را با فیزیک آن نامگذاری کنید، دامنه (ماژول، فیبر، میزبان، پیکربندی یا مدیریت) را قبل از طبقه‌بندی جدا کنید، تله‌های داخلی را بررسی کنید که مرگ ماژول را جعل می‌کنند، و روش را با فاکتور فرم8 یا QSFP2 مطابقت دهید. تماس RMA-در مقابل{4}}بازیابی حدس نمی‌زند و قابل دفاع می‌شود. وقتی یک پرونده به اندازه کافی-ارزش دارد که ضامن یک پارگی رسمی یا حکم سازگاری باشد، تجزیه و تحلیل{7}}شکست نوری ما و تیم پشتیبانی RMA می‌توانند آن را از شواهد به اثبات تبدیل کنند.

Send Inquiry