اتصال نوری با سرعت بالا: راه حل های مرکز داده

Apr 27, 2026|

سه ماهه گذشته، مشتری چهل ماژول DR4 400G داشتیم که ادعا می‌کردند فلپ‌های پیوند تصادفی روی سوئیچ‌های Arista 7060X5 خود دارند. حتی قبل از اینکه ما مدارک RMA را باز کنیم، مهندس تست ما یک سوال پرسید: آیا شما آن را بررسی کردید؟اتصالات MPOقبل از نصب؟ نداشتند. ما ماژول ها را از طریق رگرسیون کامل، نمودارهای چشمی تمیز، BER زیر 1E-13 در هر چهار خط ارسال کردیم،DDM خوانده اسمی. سپس از آن‌ها خواستیم عکس‌هایی از چهره{1} انتهای کابل صندوق عقب خود را زیر میکروسکوپ فیبری ارسال کنند. هر کانکتور دارای آلودگی ذرات بود. چهل ماژول، بدون نقص. مشکل گرد و غبار بود.

 

ما هر ماه نسخه ای از این را می بینیم. استقرار اتصالات نوری با سرعت بالا در هر مقیاسی به همان دیوار برخورد می کند، و اعداد پشتیبان آن هستند: چیزی بین 65٪ تا 70٪ از تمام خرابی های پیوند 400G و 800G به آلودگی کانکتور بازمی گردد، نه به خطاهای فرستنده گیرنده. (داده های میدانی IEEE 802.3 از طریق AscentOptics) ابتدا این موضوع را مطرح می کنیم زیرا نحوه تفکر ما در مورد کل تصمیم اتصال را مشخص می کند. ماژول تقریبا هرگز ضعیف ترین پیوند نیست. لایه فیزیکی اطراف آن است.

Microscopic view of an MPO fiber optic connector end-face showing severe dust and particulate contamination on the four precision glass cores of a 400G module, illustrating the number one cause of link failure.

 

الگوی ترافیک شما معماری اتصال نوری شما را تعیین می کند

 

همه با شماره قطعه شروع می کنند.QSFP-DD یا OSFP, SR یا DR، چند حالته یا تک حالت-. ما هم انجامش می دهیم. اما استقرارهایی که برای مشتریان ما خوب پیش رفت، همه از جای دیگری شروع شدند: ترافیک در واقع چگونه به نظر می رسد؟

آموزش هوش مصنوعی در مقیاس بزرگ-تا{2}}ارتباطات GPU را ایجاد می‌کند که به‌طور شگفت‌انگیزی در بازه‌های زمانی از چند دقیقه تا ساعت قابل پیش‌بینی است. گوگل از این موضوع با سوئیچ‌های مدار نوری در شبکه مشتری خود بهره‌برداری می‌کند و مسیرهای نور فیزیکی بین قفسه‌ها را به جای تعویض بسته‌ها، مجدداً پیکربندی می‌کند. نتایج منتشر شده آنها از یک دهه استفاده از تولید: 41 درصد کاهش توان، 30 درصد کاهش ظرفیت، و بهبود 50 برابری در زمان نصب پارچه در مقایسه با معماری قبلی Clos. (Google SIGCOMM'22) این اعداد واقعی هستند، اما متعلق به شرکتی است که چیزی بین 500 میلیون تا 1 میلیارد دلار در زیرساخت OCS در طول پنج سال هزینه کرده است. تعداد انگشت شماری از مشتریان سایز متوسط-از ما خواسته اند که امکان سنجی OCS را برای محیط آنها ارزیابی کنیم. در هر مورد، هنگامی که آنها اعداد را در مقیاس زیر-500 گره اجرا کردند، سرمایه مورد نیاز بیشتر از مزایای پیکربندی مجدد بود، و آنها با استفاده از ماژول‌های قابل اتصال در ستون ستونی معمولی باقی ماندند.

استنتاج معادله را برمیگرداند. ترافیک در سطح جریان انفجاری و غیرقابل پیش بینی است و تحمل تأخیر نزدیک به صفر است. شما نمی توانید مسیرهای نوری را بر اساس هر-درخواست مجدد پیکربندی کنید. آنچه شما نیاز دارید یک پارچه دائماً بیش از حد با تأخیر قطعی است که شما را به سمت فرستنده گیرنده های قابل اتصال در توپولوژی برگ- که در آن هر پیوند همیشه روشن است، سوق می دهد. ما ماژول ها را در هر دو سناریو می فروشیم و مکالمات مهندسی کاملاً متفاوت است. خریداران کلاستر آموزشی می خواهند درباره پهنای باند کل در هر رک و توان در هر بیت بدانند. خریداران استنباط در مورد تأخیر دم می پرسند و اینکه وقتی یک لینک از بین می رود چه اتفاقی می افتد.

 

Conceptual architectural diagram of a data center network topology comparing a custom Optical Circuit Switch (OCS) fabric for long-running AI training jobs versus a standard non-blocking Spine-Leaf topology for bursty inference workloads.

 

برای محیط‌های تجاری سنتی و کولو زیر مقیاس بزرگ، هزینه هر پورت غالب است و سازگاری با کارخانه فیبر موجود بیش از چگالی پهنای باند خام اهمیت دارد. ما خودمون رو تست کردیم400G QSFP-ماژول های DD در 14 پلت فرم سوئیچاز جمله Cisco Nexus 93600CD، Arista 7060X5، و Juniper QFX5220. در آن محیط ها، نگرانی غالب سرعت نیست. مهم این است که آیا ماژول توسط سیستم عامل سوئیچ بدون دستورات لغو دستی شناسایی می شود یا خیر.

 

منطقه مرده 800 گرمی که مهندسان را غافلگیر می کند

 

در 400G، انتخاب یک اتصال متقابل یک فرآیند-دو مرحله ای بود: اندازه گیری فاصله، انتخاب مس یا فیبر. DAC غیرفعال 3 تا 5 متر را به راحتی پوشش داد. 800G آن را شکست. هر خط دارای 112G PAM4 است. تلفات مس در این فرکانس ها در مقایسه با 400G تقریبا دو برابر می شود و نتیجه سقف سختی در حدود 2 متر برای کابل غیرفعال است.

 

High-speed cable comparison showing an Active Electrical Cable (AEC) vs a standard Direct Attach Copper (DAC) bundle. The AEC uses internal retimers to extend the 800G signal reach to 7 meters at the cost of slight latency overhead.

 

ما این روش گران قیمت را یاد گرفتیم. یک مشتری اولیه ما را سفارش دادمجموعه های DAC غیرفعال 800Gدر طول 3 متر بر اساس طرح رک 400G آنها. آموزش پیوند در بیش از 60٪ از پورت ها ناموفق بود. مس معیوب نبود. فیزیک فقط اجازه نمی دهد. آنها برای دویدن 3 تا 5 متری به AEC و ماژول های نوری قابل اتصال برای همه چیز فراتر رفتند و استقرار در عرض یک هفته تثبیت شد. از آن زمان، ما سفارشات غیرفعال 800G DAC بالای 2.5 متر را متوقف کرده ایم و یک توصیه فاصله استقرار را به فرآیند تأیید سفارش خود اضافه کرده ایم.

 

AEC اکنون صاحب شکاف 3 تا 7 متری است. تایمرهای دیجیتال سیگنال را به صورت الکتریکی و بدون تبدیل نوری بازسازی می‌کنند، که هزینه را پایین نگه می‌دارد اما تأخیر را افزایش می‌دهد. KP4 FEC به تنهایی 50 تا 100 نانوثانیه را در هر پرش در 800G قرار می دهد، و retimer بیشتر در بالای صفحه قرار می گیرد. کل تأخیر اضافه شده را در مجموعه های AEC که در حال حاضر ارسال می کنیم، بین 85 تا 110 ns اندازه گیری کردیم. برای پیوندهای پارچه{10}}برگی ستون فقرات، این سربار در عملکرد برنامه قابل مشاهده نیست. برای خوشه‌های GPU که با هم جفت شده‌اند، داستان متفاوت است. بر اساس داده‌های نمایه‌سازی از سه استقرار مشتری که گره‌های H100 را اجرا می‌کنند، اگر سربار ارتباط شغل آموزشی شما از قبل بالای 15 درصد باشد، آن صد نانوثانیه اضافی در هر پرش در چندین لایه سوئیچ شروع به ترکیب در عملیات NCCL AllReduce می‌کند.

 

فراتر از 7 متر، فرستنده های نوری قابل اتصال برای 800G تنها مسیر قابل دوام هستند. تقاضاهای لایه فیزیکی در اینجا به میزان قابل توجهی سفت می شوند. خاتمه-تا-پایان دادن بودجه تلفات درج تحت IEEE 802.3ck به کمتر از 1.5 دسی بل برای اکثر کلاس های دسترسی 800G، و هر اتصال MPO جفت شده باید کمتر از 0.35 دسی بل باقی بماند. ما شاهد بوده ایم فیبر نصب شده ای که گواهینامه 100G را دریافت کرده است، پس از چندین سال فشرده سازی در سینی های کابل، مقادیر PMD را دو تا سه برابر بیشتر از مشخصات رتبه بندی شده خود نشان می دهد، مطابق با آنچه تیم تحقیقاتی شبکه Juniper در سال 2023 گزارش کرده است. توصیه استاندارد ما قبل از استقرار فرستنده گیرنده 800G: هر بخش مشخصه OTDR و PMD موجود را اجرا کنید. نمونه نیست هر بخش هزینه باز{17} کشیدن دو کابل تنه کسری از هزینه رفع اشکال فلپ های پیوند متناوب به مدت شش ماه است.

 

CPO در مقابل LPO در مقابل Pluggable: جایی که هر فناوری در واقع در سال 2026 ایستاده است

 

اپتیک‌های بسته‌بندی شده شرکت، نحوه ایجاد زیرساخت سوئیچینگ مرکز داده را تغییر می‌دهد. ما این را به عنوان یک تولید کننده ماژول قابل اتصال می گوییم، بنابراین دیدگاه خود را به جای خنثی، آگاهانه در نظر بگیرید.

 

در OFC 2026، داده های قابلیت اطمینان در نمونه های اولیه CPO نشان داد که نرخ خرابی به طور بالقوه کمتر از ماژول های قابل اتصال سنتی است. بدون چرخه های درج مکانیکی یا سطوح اتصال دهنده در معرض، حالت های شکست غالب ماژول های قابل اتصال به سادگی اعمال نمی شود. پلتفرم سوئیچ Bailly 51.2T CPO Broadcom تقریباً 70٪ مصرف انرژی کمتری را در لایه نوری در مقایسه با پیکربندی‌های قابل اتصال معادل نشان داد. (گزارش اتصال نوری DataMINtelligence) NVIDIA سوئیچ‌های یکپارچه CPO را در مقیاس هدف‌گیری GTC 2026-در پنجره ۲۰۲۷ تا ۲۰۲۸ نشان داد.

 

موضع ما: اگر شما یک سیلیکون سوئیچ سفارشی ساخت هایپراسکیلر نیستید، اپتیک های قابل اتصال تنها گزینه قابل استقرار شما حداقل تا سال 2027 است. CPO به معماری‌های بردی نیاز دارد که اکثر فروشندگان سوئیچ هنوز ارسال نکرده‌اند، استانداردهای کانکتوری که نهایی نشده‌اند، و یک کتاب بازی کاملاً جدید برای مدیریت خرابی‌هایی که نمی‌توانید با کشیدن یک ماژول برطرف کنید. اکوسیستم برای تدارکات سازمانی عمومی هنوز وجود ندارد. در سال گذشته دو مشتری بالقوه داشتیم که ارتقاء 400G-به 800G خود را در انتظار CPO به تاخیر انداختند. هر دو در نهایت بازگشتند و پس از اینکه شکاف پهنای باند آنها به حوادث تولید تبدیل شد، سفارش‌های قابل اتصال دادند. ما در مورد منطق مهندسی برای این موقعیت با جزئیات بیشتری در سایت خود نوشتیمتجزیه و تحلیل معماری فرستنده گیرنده قابل اتصال.

 

LPO در فضای متفاوتی قرار دارد. با حذف DSP از ماژول، یکی از اجزای{1}}گرسنه با بیشترین انرژی که تا نیمی از کل مصرف برق ماژول را به عهده دارد، قطع می شود. نتیجه 30 تا 50 درصد مصرف کمتر و تا 15 نانوثانیه تاخیر کمتر است. ما در اواخر سال 2025{7}}RFQهای خاص LPO را شروع کردیم. سه مورد از چهار مورد از مشتریانی بودند که دسته‌های گرافیکی تک فروشنده-در NVIDIA Spectrum{10}}X می‌سازند. پارچه‌های چند فروشنده{12}}هیچ‌کدام کار نمی‌کند، که همه چیز را در مورد محل کار امروز LPO به شما می‌گوید. اگر شبکه شما فروشندگان سوئیچ را ترکیب می کند، LPO با محیط شما سازگار نیست. اگر یک خوشه هوش مصنوعی{15}}فروشنده را اجرا می‌کنید، ممکن است هوشمندترین ارتقای موجود باشد و ما انتظار داریم تا اواسط سال 2027 ماژول‌های آماده LPO{16}}را در صلاحیت داشته باشیم.

معنای حاشیه حرارتی 800G برای انتخاب ماژول

 

ریاضیات حرارتی در 800G مردم را غافلگیر می کند. چگالی توان اتصال نوری با سرعت بالا در این نسل مشکلاتی را ایجاد می کند که به سادگی در 400G وجود نداشت. یک سوئیچ 64 پورت که به طور کامل با ماژول های 800G در 16 وات بارگذاری شده است، هر کدام تقریباً 1 کیلو وات قدرت فرستنده گیرنده را به تنهایی می کشد، قبل از اینکه سوئیچ ASIC 400 تا 500 وات داشته باشد. این 1.4 تا 1.5 کیلو وات در هر سوئیچ است. هشت سوئیچ در یک لایه ستون فقرات به تنهایی بیش از 11 کیلو وات را از تجهیزات شبکه، در رک هایی که اغلب برای 8 تا 10 کیلو وات تهیه می کردند، می دهد.

 

Juniper Networks صریحاً هشدار می‌دهد که ماژول‌های شخص ثالث- با مصرف انرژی بالا، به‌ویژه انواع منسجم ZR و ZR+، می‌توانند باعث آسیب حرارتی به تجهیزات میزبان شوند و مسئولیت آن متوجه کاربر است. (سوالات متداول Juniper Networks 800G Optics) این آرگومان علیه ماژول‌های نوری شخص ثالث- نیست. این استدلالی است برای دانستن اینکه دقیقاً چه چیزی را به برق وصل می‌کنید. در شرایط صلاحیت دوچرخه‌سواری حرارتی، ما هر طراحی ماژول 800G را در دمای تقاطع 85 درجه ثابت به مدت 2000 ساعت آزمایش می‌کنیم و رانش جریان بایاس لیزر را به‌عنوان شاخص اولیه پیری دنبال می‌کنیم. واحدهایی که بیش از 38 میلی آمپر رانده می شوند از خط تولید خارج می شوند. در تراکم 800G، تفاوت بین یک ماژول با توان 14 وات و یک ماژول کششی 18 وات تعیین می‌کند که آیا رک در پوشش حرارتی باقی می‌ماند یا آلارم خاموش شدن را در ساعت 2 بامداد فعال می‌کند. اشتباه گرفتن مشخصات همیشه آزاردهنده بوده است. در این سطوح قدرت، گران است.

Thermal heatmap of a high-density switch rack illustrating extreme heat concentration in the transceiver cage area where 64 modules drawing 16W each generate significant thermal load, nearing cooling capacity limits.

 

 

ما ماژول های قابل اتصال را از 1G SFP تا 800G OSFP ارسال می کنیم و در برابر پلتفرم های سوئیچ اصلی آزمایش می کنیم. ما در مورد اینکه چه چیزی کار می کند و چه چیزی کار نمی کند، سوابق نگهداری می کنیم. اگر به بررسی سازگاری با یک محیط سوئیچ خاص نیاز دارید، یا می‌خواهید مشخصات حرارتی و برق{4}}کلاس رک‌های 800G با چگالی بالا-را داشته باشید، مهندسان ما این مکالمات را هر هفته اجرا می‌کنند. ما800G OSFP و QSFP-صفحه فرستنده گیرنده DD800دارای مشخصات، دسترسی{0}}گزینه‌های کلاس، و نمونه فرم‌های درخواست برای هر ماژولی که ارسال می‌کنیم.

Send Inquiry