LinkedIn, büyük öğretmen modellerinden gelen bilgileri 0,6B parametreli kompakt bir sıralama modeline sıkıştıran çok öğretmenli bir damıtma hattını açıklayan yapay zeka destekli iş aramanın arkasındaki eğitim altyapısının ayrıntılarını yayınladı. Asıl katkı sadece damıtma tekniği değildir. Sistemin yineleme için yeterince hızlı olmasını sağlayan şey sistemin çalışmasıdır. Bu, doğrudan eğitim döngüsünde öğretmen modellerine hizmet eden, SGLang üzerine inşa edilmiş özel bir çerçeveyi içerir.
Tıklamalar ve uygulamalar gibi alaka ve etkileşim hedeflerini iyileştirmek için küçük bir dil modelinin (SLM) eğitilmesi, her eğitim örneği için bir veya daha fazla büyük öğretmen modelinin sorgulanmasını gerektirir. Bu öğretmenlere hizmet vermek süreci yavaşlatabilir. Bu, LinkedIn ölçeğinde saniyede yüzbinlerce sorguyu işlemek zorunda olan bir sıralama sistemi için bir darboğaz haline geliyor. Birçok arama ve yönlendirme ekibi ortak bir zorlukla karşı karşıyadır. Anahtar kelimeye dayalı sistemlerden LLM’ler tarafından denetlenen birleşik sıralamalara geçmekte zorlanıyorlar.
LinkedIn, SGLang’ı kullanarak çok öğretmenli bir damıtma çerçevesi oluşturdu. Bu sistem çeşitli boyutlardaki öğretmen modellerini yükler ve hizmet verir. Ayrıca tensör paralel ve veri paralel ayarlarını da yönetir. Eşzamansız bir müşteri, eğitim sırasında öğretmenleri sorgular. Çıktılarını işleyerek damıtma kayıplarına ekler. Ekip bu yönteme Çevrimiçi Çok Teknolojili Damıtma adını veriyor. Bunu yerel öğretmen kopyalarıyla birden fazla düğümde ölçeklendirmek, damıtma sürecini 3 kat hızlandırdı. Ayrıca gecikmeyi düşük tutarak hızlı yinelemelere olanak sağladı. Genel hizmet maliyetini azaltmak ve tekrarlanan hesaplamaları önlemek için LinkedIn, Çevrimdışı Çoklu Öğretmen Damıtma’yı tanıttı. Bu modda sistem öğretmenin çıktılarını önceden hesaplar ve bunları HDFS veya NFS’de saklar. Daha sonra gerçek zamanlı olarak sorgulanmak yerine doğrudan eğitimde kullanılırlar.

Bu çevrimiçi/çevrimdışı ayrımı, daha geniş bir eğitim seviyesi optimizasyon yığınının yanında yer alır: bellek kullanımını azaltmak ve iki kat daha büyük toplu iş boyutları sağlamak için LiGer’in benimsenmesi, 3,5 kata kadar ek hızlanma için çok düğümlü eğitim, %20 ek kazanç için FSDP2 ve %30’a kadar daha fazla için çok düğümlü H200 kümeleri. Ekip, FP8 karma hassasiyetini değerlendirdiklerini, ancak döküm masraflarının hesaplama tasarruflarından daha ağır basması nedeniyle 8B parametrelerinin altındaki modeller için hiçbir fayda bulamadıklarını belirtiyor. Bu optimizasyonlar bir araya getirildiğinde, yazı başlığında bahsedilen yaklaşık sekiz kat eğitim hızlandırmasını açıklıyor.
Modelleme açısından, LinkedIn araştırması 0,6 milyar öğrenci modelinin iş arama sonuçlarını iyileştirdiğini gösteriyor. Bu model, 8B alaka kahininden ve 1.7B katılım öğretmeninden geliyor. İş aramaları için NDCG@10’u %24,48 artırarak 0,7583’ten 0,9432’ye çıkardı. Aynı araştırmada çıkarım düzeyinde yapılan çalışmalar, yapılandırılmış budama ve bağlam sıkıştırmayı içeriyordu. Bu yöntemler, sıralama verimini GPU başına saniyede yaklaşık 290 öğeden 2.000 öğenin üzerine çıkardı.
Sistem şu anda üretimde olup, ABD’deki LinkedIn kullanıcıları için doğal dilde iş aramalarına destek vermektedir. Tescilli bir hizmet yığını yerine, LinkedIn’in önceki sıralama iş yükleri için yatırım yaptığı açık kaynaklı LLM hizmet motoru olan SGLang üzerine inşa edilmiştir. LinkedIn bu çalışmayı ekipler için bir rehber olarak sunuyor. Gerçek zamanlı gecikme ihtiyaçlarını karşılarken kaliteli kodlayıcılar arası sıralama elde etmelerine yardımcı olur. Ek olarak, her istek için sınır-LLM çıkarımının kullanılmasının yüksek maliyetini de ortadan kaldırır.
Benzer Yüksek Lisans denetimli sıralama sistemleri oluşturan takımlar, öğretmenler için çevrimiçi/çevrimdışı ayrımını kullanabilir. Öğretmen tercihleri değiştiğinde erken aşamalarda çevrimiçi sorgulama yapabilirler. Öğretmenler alıştıktan ve sorgu hacmi arttıkça çevrimdışı önbelleğe almaya geçebilirler. Bileşik kazanç, sadece bir hile değil. LiGer, çok düğümlü veri paralelliği, FSDP2 ve yeni nesil GPU’ların her biri orta düzeyde bir artış sağlıyor. Ayrıca bunların hiçbiri 8B’nin altındaki model boyutları için FP8’e ihtiyaç duymadı. Bu ayrıntı, varsayılan olarak daha düşük doğruluğu düşünen ekipler için önemlidir.
Haziran 2026’da Pinterest, Pinterest’in Temel Modelleri için Doğrusala Yakın Eğitim Ölçeklenebilirliğine Ulaşmak adlı benzer bir hesap başlattı. Bu makale, çok düğümlü eğitimin daha büyük öğretmen modelleri oluşturmaya nasıl yardımcı olduğunu açıkladı. Bu modellerden elde edilen bilgiler daha sonra Evden Besleme ve İlgili Pinlerin sıralanması için daha etkili öğrenci modellerine dönüştürüldü. Bu süreç, deney döngülerini birkaç haftadan bu sürenin sadece bir kısmına indirdi. LinkedIn’in rolü, öğretmenlerin eğitim sırasında canlı olarak test edilmesine olanak tanıyan özelleştirilmiş bir SGLang çerçevesi oluşturmaktır.
Pinterest, eğitim çerçevesini ölçeklendirmeye odaklanıyor ve Dağıtılmış Kontrol Noktasına geçerek çok düğümlü öğretmen eğitimini mümkün kılıyor. 2026’da Damıtma (Şimdiye Kadar): Hangi Sınır Modellerinin Kullandığı ve Nasıl Kullanıldığı adlı yeni bir anket, çok öğretmenli damıtmadaki ilerlemeleri vurguluyor. Yoğun, sembol düzeyinde gözetim için on veya daha fazla uzman öğretmenin kullanıldığı NVIDIA Nemotron 3 Ultra, MiMo-V2-Flash ve DeepSeek-V4’e sahiptir. Öğretmen havuzunun bu karmaşıklığı, daha az göreve özel öğretmen kullanan LinkedIn ve Pinterest gibi sektör sıralama sistemlerinin ihtiyaçlarını aşıyor.