Moonshot’un, Kimi K3 adıyla tanıttığı, mevcut en büyük açık ağırlıklı dil modeli, Anthropic’in Fable LLM’sini kopyalayarak geliştirilmiş. Ancak bu süreçte, Çin’e ihracatı yasaklı olan çiplerin kullanıldığı iddia ediliyor.
Beyaz Saray bilim danışmanı Michael Kratsios, “Büyük ölçekli, gizli sanayi damıtma ile ABD’nin patentli teknolojisinin çalınması ve Amerikan araştırmasının zayıflatılması kabul edilemez,” dedi. Bu açıklama, AI sektörünü sarsan Çin’in açık ağırlıklı modellerinin yasaklanması konusundaki tartışmaların ortasında yapıldı. Moonshot, eğitim süreci hakkında soruları yanıtlamadı ve Kratsios, iddialarının kaynağıyla ilgili daha fazla ayrıntı paylaşmadı.
Hazine Bakanı Scott Bessent de, “Çin modellerinde ABD dil modellerimizin su işaretlerini buluyoruz ve bu kabul edilemez,” diyerek Kratsios’un açıklamalarını destekledi. Ancak bu su işaretlerinin ne olduğu belirsizliğini koruyor ve Hazine Bakanlığı, gelen sorulara cevap vermedi.
Uzmanlar, Kimi K3’ün gösterdiği gelişmiş yeteneklerin, damıtma sürecinin bir sonucu olduğuna pek inanmadıklarını belirtiyor. Laude Enstitüsü’nden araştırmacı Braden Hancock, “Fable tam anlamıyla damıtma yöntemiyle bu kadar güçlü bir model elde edemezsiniz,” dedi. Fable’ın 1 Temmuz’da halka açıldığını hatırlatan Hancock, “İki hafta içinde bu kadar veri damıtmak, bir modeli eğitmek ve piyasaya sürmek mümkün değil,” ifadelerini kullandı.
Allen AI Enstitüsü’nden AI araştırmacısı Nathan Lambert ise, damıtma sürecinin zamanla daha az etkili hale geldiğini belirtiyor. Lambert, “Herkes, yalnızca SFT ile bir GLM veya K3’e kolayca yetişebilir, ancak bunu göremiyoruz,” dedi. Damıtma yapmak, hedef model üzerinde sistematik sorgulama yapmayı gerektiriyor.
Bu sorgulamalar, bazen modelin nasıl düşündüğünü ifade etmesi açısından yapılırken; bazen de SFT olarak adlandırılan bir süreçte yeni bir modeli eğitmek amacıyla kullanılıyor. Lambert, “Fine-tuning süreci, bir modele ‘görgü kurallarını’ kazandırdığını düşündüğüm işlem,” dedi.
Fakat Lambert, SFT’nin faydalarının, modellerin karmaşıklaşmasıyla birlikte azaldığını da vurguluyor. Gelişmiş yetenekleri damıtmak için pek çok durumda güçlendirme öğrenme teknikleri gerekmekte. Bu, genellikle daha büyük bir modelin, daha küçük modelin yanıtlarını değerlendirmesini ve derecelendirmesine bağlı olarak ayarlama yapılmasını içeriyor.
Gelişmiş teknikler, ayrıca daha önemli bir alt yapı gerektiriyor. Büyük ölçekli güçlendirme öğrenimi işlemleri, on milyonlarca ajana ihtiyaç duyabiliyor. Bir öncü laboratuvarın API’sını bu amaçla kullanmak oldukça maliyetli ve zaman alıcı olabilir.
Kimi’nin önceki öncül modellerden etkilendiği düşünülüyor; Anthropic, Moonshot’u, DeepSeek ve MiniMax’ı bu yılın başlarında istatistiksel olarak eleştirmişti. Anthropic, belirli şirketlerle IP adresleri ve diğer meta veriler üzerinden izlediği milyonlarca işlem bulduğunu belirtti. Bu sorgular, “normal kullanım kalıplarından farklıydı ve kasıtlı yetenek çıkarımı” olarak tanımlandı.
Ancak damıtma süreci, yalnızca Çin’deki AI şirketleri arasında yaygın değil. Elon Musk, bu yıl SpaceXAI’in OpenAI modellerini kullanarak Grok geliştirdiğini açıklamış ve bu pratiğin sektörde yaygın olduğunu belirtmişti. Damıtma ile yapay veri setleri oluşturma arasındaki sınır ise oldukça belirsiz.
Hancock, “Amerikan takımların teknik yetkinliğini hafife aldığını düşünüyorum. Moonshot’un kurucularından biri CMU’de doktora yapmış bir öğrenci,” dedi ve Çinli araştırmacıların ciddi çalışmalar yaptığını vurguladı. Eğer Amerikan modellerinde bir duraklama olursa, Çin’in ilerlemesi yavaşlayabilir ama durmaz.
Kratsios’un yorumlarındaki diğer bir konu ise, Moonshot’un ileri düzey Nvidia çiplerine erişim sağlaması. Bu çipler, Çin’ için yasaklı, ancak yasadışı bir piyasası olduğu öne sürülüyor. Georgetown Üniversitesi Güvenlik ve Gelişen Teknolojiler Merkezi’nde araştırmacı olan Sam Bresnick, “Veri merkezlerinde müşterinizi tanıma yasalarını destekliyorum,” dedi. “Eğer bir şirket, en son teknolojilere sahip altyapınızda büyük eğitim çalışmalarını yapıyorsa, bu şirketin kim olduğunu bildirmek için bir mekanizma olmalı.”
Başkan Joe Biden’ın Ticaret Departmanı, 2024’te veri merkezleri için müşteri tanıma kuralları önerdi, ancak daha fazla ilerleme kaydedildiğine dair bir bilgi yok. Gelişmiş çiplerin ihraç edilmesi durumunda, yalnızca onaylı amaçlar için kullanılması gerektiği belirtiliyor.
AI teknolojilerinin bu karmaşık durumu hakkında siz neler düşünüyorsunuz?

