اتصال نوری با سرعت بالا: راه حل های مرکز داده
Apr 27, 2026| سه ماهه گذشته، مشتری چهل ماژول DR4 400G داشتیم که ادعا میکردند فلپهای پیوند تصادفی روی سوئیچهای Arista 7060X5 خود دارند. حتی قبل از اینکه ما مدارک RMA را باز کنیم، مهندس تست ما یک سوال پرسید: آیا شما آن را بررسی کردید؟اتصالات MPOقبل از نصب؟ نداشتند. ما ماژول ها را از طریق رگرسیون کامل، نمودارهای چشمی تمیز، BER زیر 1E-13 در هر چهار خط ارسال کردیم،DDM خوانده اسمی. سپس از آنها خواستیم عکسهایی از چهره{1} انتهای کابل صندوق عقب خود را زیر میکروسکوپ فیبری ارسال کنند. هر کانکتور دارای آلودگی ذرات بود. چهل ماژول، بدون نقص. مشکل گرد و غبار بود.
ما هر ماه نسخه ای از این را می بینیم. استقرار اتصالات نوری با سرعت بالا در هر مقیاسی به همان دیوار برخورد می کند، و اعداد پشتیبان آن هستند: چیزی بین 65٪ تا 70٪ از تمام خرابی های پیوند 400G و 800G به آلودگی کانکتور بازمی گردد، نه به خطاهای فرستنده گیرنده. (داده های میدانی IEEE 802.3 از طریق AscentOptics) ابتدا این موضوع را مطرح می کنیم زیرا نحوه تفکر ما در مورد کل تصمیم اتصال را مشخص می کند. ماژول تقریبا هرگز ضعیف ترین پیوند نیست. لایه فیزیکی اطراف آن است.

الگوی ترافیک شما معماری اتصال نوری شما را تعیین می کند
همه با شماره قطعه شروع می کنند.QSFP-DD یا OSFP, SR یا DR، چند حالته یا تک حالت-. ما هم انجامش می دهیم. اما استقرارهایی که برای مشتریان ما خوب پیش رفت، همه از جای دیگری شروع شدند: ترافیک در واقع چگونه به نظر می رسد؟
آموزش هوش مصنوعی در مقیاس بزرگ-تا{2}}ارتباطات GPU را ایجاد میکند که بهطور شگفتانگیزی در بازههای زمانی از چند دقیقه تا ساعت قابل پیشبینی است. گوگل از این موضوع با سوئیچهای مدار نوری در شبکه مشتری خود بهرهبرداری میکند و مسیرهای نور فیزیکی بین قفسهها را به جای تعویض بستهها، مجدداً پیکربندی میکند. نتایج منتشر شده آنها از یک دهه استفاده از تولید: 41 درصد کاهش توان، 30 درصد کاهش ظرفیت، و بهبود 50 برابری در زمان نصب پارچه در مقایسه با معماری قبلی Clos. (Google SIGCOMM'22) این اعداد واقعی هستند، اما متعلق به شرکتی است که چیزی بین 500 میلیون تا 1 میلیارد دلار در زیرساخت OCS در طول پنج سال هزینه کرده است. تعداد انگشت شماری از مشتریان سایز متوسط-از ما خواسته اند که امکان سنجی OCS را برای محیط آنها ارزیابی کنیم. در هر مورد، هنگامی که آنها اعداد را در مقیاس زیر-500 گره اجرا کردند، سرمایه مورد نیاز بیشتر از مزایای پیکربندی مجدد بود، و آنها با استفاده از ماژولهای قابل اتصال در ستون ستونی معمولی باقی ماندند.
استنتاج معادله را برمیگرداند. ترافیک در سطح جریان انفجاری و غیرقابل پیش بینی است و تحمل تأخیر نزدیک به صفر است. شما نمی توانید مسیرهای نوری را بر اساس هر-درخواست مجدد پیکربندی کنید. آنچه شما نیاز دارید یک پارچه دائماً بیش از حد با تأخیر قطعی است که شما را به سمت فرستنده گیرنده های قابل اتصال در توپولوژی برگ- که در آن هر پیوند همیشه روشن است، سوق می دهد. ما ماژول ها را در هر دو سناریو می فروشیم و مکالمات مهندسی کاملاً متفاوت است. خریداران کلاستر آموزشی می خواهند درباره پهنای باند کل در هر رک و توان در هر بیت بدانند. خریداران استنباط در مورد تأخیر دم می پرسند و اینکه وقتی یک لینک از بین می رود چه اتفاقی می افتد.

برای محیطهای تجاری سنتی و کولو زیر مقیاس بزرگ، هزینه هر پورت غالب است و سازگاری با کارخانه فیبر موجود بیش از چگالی پهنای باند خام اهمیت دارد. ما خودمون رو تست کردیم400G QSFP-ماژول های DD در 14 پلت فرم سوئیچاز جمله Cisco Nexus 93600CD، Arista 7060X5، و Juniper QFX5220. در آن محیط ها، نگرانی غالب سرعت نیست. مهم این است که آیا ماژول توسط سیستم عامل سوئیچ بدون دستورات لغو دستی شناسایی می شود یا خیر.
منطقه مرده 800 گرمی که مهندسان را غافلگیر می کند
در 400G، انتخاب یک اتصال متقابل یک فرآیند-دو مرحله ای بود: اندازه گیری فاصله، انتخاب مس یا فیبر. DAC غیرفعال 3 تا 5 متر را به راحتی پوشش داد. 800G آن را شکست. هر خط دارای 112G PAM4 است. تلفات مس در این فرکانس ها در مقایسه با 400G تقریبا دو برابر می شود و نتیجه سقف سختی در حدود 2 متر برای کابل غیرفعال است.

ما این روش گران قیمت را یاد گرفتیم. یک مشتری اولیه ما را سفارش دادمجموعه های DAC غیرفعال 800Gدر طول 3 متر بر اساس طرح رک 400G آنها. آموزش پیوند در بیش از 60٪ از پورت ها ناموفق بود. مس معیوب نبود. فیزیک فقط اجازه نمی دهد. آنها برای دویدن 3 تا 5 متری به AEC و ماژول های نوری قابل اتصال برای همه چیز فراتر رفتند و استقرار در عرض یک هفته تثبیت شد. از آن زمان، ما سفارشات غیرفعال 800G DAC بالای 2.5 متر را متوقف کرده ایم و یک توصیه فاصله استقرار را به فرآیند تأیید سفارش خود اضافه کرده ایم.
AEC اکنون صاحب شکاف 3 تا 7 متری است. تایمرهای دیجیتال سیگنال را به صورت الکتریکی و بدون تبدیل نوری بازسازی میکنند، که هزینه را پایین نگه میدارد اما تأخیر را افزایش میدهد. KP4 FEC به تنهایی 50 تا 100 نانوثانیه را در هر پرش در 800G قرار می دهد، و retimer بیشتر در بالای صفحه قرار می گیرد. کل تأخیر اضافه شده را در مجموعه های AEC که در حال حاضر ارسال می کنیم، بین 85 تا 110 ns اندازه گیری کردیم. برای پیوندهای پارچه{10}}برگی ستون فقرات، این سربار در عملکرد برنامه قابل مشاهده نیست. برای خوشههای GPU که با هم جفت شدهاند، داستان متفاوت است. بر اساس دادههای نمایهسازی از سه استقرار مشتری که گرههای H100 را اجرا میکنند، اگر سربار ارتباط شغل آموزشی شما از قبل بالای 15 درصد باشد، آن صد نانوثانیه اضافی در هر پرش در چندین لایه سوئیچ شروع به ترکیب در عملیات NCCL AllReduce میکند.
فراتر از 7 متر، فرستنده های نوری قابل اتصال برای 800G تنها مسیر قابل دوام هستند. تقاضاهای لایه فیزیکی در اینجا به میزان قابل توجهی سفت می شوند. خاتمه-تا-پایان دادن بودجه تلفات درج تحت IEEE 802.3ck به کمتر از 1.5 دسی بل برای اکثر کلاس های دسترسی 800G، و هر اتصال MPO جفت شده باید کمتر از 0.35 دسی بل باقی بماند. ما شاهد بوده ایم فیبر نصب شده ای که گواهینامه 100G را دریافت کرده است، پس از چندین سال فشرده سازی در سینی های کابل، مقادیر PMD را دو تا سه برابر بیشتر از مشخصات رتبه بندی شده خود نشان می دهد، مطابق با آنچه تیم تحقیقاتی شبکه Juniper در سال 2023 گزارش کرده است. توصیه استاندارد ما قبل از استقرار فرستنده گیرنده 800G: هر بخش مشخصه OTDR و PMD موجود را اجرا کنید. نمونه نیست هر بخش هزینه باز{17} کشیدن دو کابل تنه کسری از هزینه رفع اشکال فلپ های پیوند متناوب به مدت شش ماه است.
CPO در مقابل LPO در مقابل Pluggable: جایی که هر فناوری در واقع در سال 2026 ایستاده است
اپتیکهای بستهبندی شده شرکت، نحوه ایجاد زیرساخت سوئیچینگ مرکز داده را تغییر میدهد. ما این را به عنوان یک تولید کننده ماژول قابل اتصال می گوییم، بنابراین دیدگاه خود را به جای خنثی، آگاهانه در نظر بگیرید.
در OFC 2026، داده های قابلیت اطمینان در نمونه های اولیه CPO نشان داد که نرخ خرابی به طور بالقوه کمتر از ماژول های قابل اتصال سنتی است. بدون چرخه های درج مکانیکی یا سطوح اتصال دهنده در معرض، حالت های شکست غالب ماژول های قابل اتصال به سادگی اعمال نمی شود. پلتفرم سوئیچ Bailly 51.2T CPO Broadcom تقریباً 70٪ مصرف انرژی کمتری را در لایه نوری در مقایسه با پیکربندیهای قابل اتصال معادل نشان داد. (گزارش اتصال نوری DataMINtelligence) NVIDIA سوئیچهای یکپارچه CPO را در مقیاس هدفگیری GTC 2026-در پنجره ۲۰۲۷ تا ۲۰۲۸ نشان داد.
موضع ما: اگر شما یک سیلیکون سوئیچ سفارشی ساخت هایپراسکیلر نیستید، اپتیک های قابل اتصال تنها گزینه قابل استقرار شما حداقل تا سال 2027 است. CPO به معماریهای بردی نیاز دارد که اکثر فروشندگان سوئیچ هنوز ارسال نکردهاند، استانداردهای کانکتوری که نهایی نشدهاند، و یک کتاب بازی کاملاً جدید برای مدیریت خرابیهایی که نمیتوانید با کشیدن یک ماژول برطرف کنید. اکوسیستم برای تدارکات سازمانی عمومی هنوز وجود ندارد. در سال گذشته دو مشتری بالقوه داشتیم که ارتقاء 400G-به 800G خود را در انتظار CPO به تاخیر انداختند. هر دو در نهایت بازگشتند و پس از اینکه شکاف پهنای باند آنها به حوادث تولید تبدیل شد، سفارشهای قابل اتصال دادند. ما در مورد منطق مهندسی برای این موقعیت با جزئیات بیشتری در سایت خود نوشتیمتجزیه و تحلیل معماری فرستنده گیرنده قابل اتصال.
LPO در فضای متفاوتی قرار دارد. با حذف DSP از ماژول، یکی از اجزای{1}}گرسنه با بیشترین انرژی که تا نیمی از کل مصرف برق ماژول را به عهده دارد، قطع می شود. نتیجه 30 تا 50 درصد مصرف کمتر و تا 15 نانوثانیه تاخیر کمتر است. ما در اواخر سال 2025{7}}RFQهای خاص LPO را شروع کردیم. سه مورد از چهار مورد از مشتریانی بودند که دستههای گرافیکی تک فروشنده-در NVIDIA Spectrum{10}}X میسازند. پارچههای چند فروشنده{12}}هیچکدام کار نمیکند، که همه چیز را در مورد محل کار امروز LPO به شما میگوید. اگر شبکه شما فروشندگان سوئیچ را ترکیب می کند، LPO با محیط شما سازگار نیست. اگر یک خوشه هوش مصنوعی{15}}فروشنده را اجرا میکنید، ممکن است هوشمندترین ارتقای موجود باشد و ما انتظار داریم تا اواسط سال 2027 ماژولهای آماده LPO{16}}را در صلاحیت داشته باشیم.
معنای حاشیه حرارتی 800G برای انتخاب ماژول
ریاضیات حرارتی در 800G مردم را غافلگیر می کند. چگالی توان اتصال نوری با سرعت بالا در این نسل مشکلاتی را ایجاد می کند که به سادگی در 400G وجود نداشت. یک سوئیچ 64 پورت که به طور کامل با ماژول های 800G در 16 وات بارگذاری شده است، هر کدام تقریباً 1 کیلو وات قدرت فرستنده گیرنده را به تنهایی می کشد، قبل از اینکه سوئیچ ASIC 400 تا 500 وات داشته باشد. این 1.4 تا 1.5 کیلو وات در هر سوئیچ است. هشت سوئیچ در یک لایه ستون فقرات به تنهایی بیش از 11 کیلو وات را از تجهیزات شبکه، در رک هایی که اغلب برای 8 تا 10 کیلو وات تهیه می کردند، می دهد.
Juniper Networks صریحاً هشدار میدهد که ماژولهای شخص ثالث- با مصرف انرژی بالا، بهویژه انواع منسجم ZR و ZR+، میتوانند باعث آسیب حرارتی به تجهیزات میزبان شوند و مسئولیت آن متوجه کاربر است. (سوالات متداول Juniper Networks 800G Optics) این آرگومان علیه ماژولهای نوری شخص ثالث- نیست. این استدلالی است برای دانستن اینکه دقیقاً چه چیزی را به برق وصل میکنید. در شرایط صلاحیت دوچرخهسواری حرارتی، ما هر طراحی ماژول 800G را در دمای تقاطع 85 درجه ثابت به مدت 2000 ساعت آزمایش میکنیم و رانش جریان بایاس لیزر را بهعنوان شاخص اولیه پیری دنبال میکنیم. واحدهایی که بیش از 38 میلی آمپر رانده می شوند از خط تولید خارج می شوند. در تراکم 800G، تفاوت بین یک ماژول با توان 14 وات و یک ماژول کششی 18 وات تعیین میکند که آیا رک در پوشش حرارتی باقی میماند یا آلارم خاموش شدن را در ساعت 2 بامداد فعال میکند. اشتباه گرفتن مشخصات همیشه آزاردهنده بوده است. در این سطوح قدرت، گران است.

ما ماژول های قابل اتصال را از 1G SFP تا 800G OSFP ارسال می کنیم و در برابر پلتفرم های سوئیچ اصلی آزمایش می کنیم. ما در مورد اینکه چه چیزی کار می کند و چه چیزی کار نمی کند، سوابق نگهداری می کنیم. اگر به بررسی سازگاری با یک محیط سوئیچ خاص نیاز دارید، یا میخواهید مشخصات حرارتی و برق{4}}کلاس رکهای 800G با چگالی بالا-را داشته باشید، مهندسان ما این مکالمات را هر هفته اجرا میکنند. ما800G OSFP و QSFP-صفحه فرستنده گیرنده DD800دارای مشخصات، دسترسی{0}}گزینههای کلاس، و نمونه فرمهای درخواست برای هر ماژولی که ارسال میکنیم.


