Microsoft, 3 Saniyelik İstemlerden Herhangi Bir Sesi Simüle Eden Ses Yapay Zekası VALL-E'yi Tanıttı - Dünyadan Güncel Teknoloji Haberleri

Microsoft araştırmacıları kısa bir süre önce, üç saniyelik bir ses örneği verildiğinde bir kişinin sesini doğru bir şekilde taklit edebilen yeni bir metinden konuşmaya yapay zeka modeli olan VALL-E’yi duyurdu. VALL-E, belirli bir sesi öğrendiğinde, konuşmacının duygusal tonunu korumaya çalışırken, herhangi bir şey söyleyen kişinin sesini sentezleyebilir. VALL-E’nin yaratıcıları, GPT-3 gibi diğer üretken AI modelleriyle birleştirildiğinde, yüksek kaliteli metin okuma uygulamaları, bir kişinin kaydının düzenlenebildiği ve bir metin dökümünden değiştirilebildiği konuşma düzenleme için kullanılabileceğine inanıyor. (aslında söylemedikleri bir şeyi söylemelerini sağlamak) ve sesli içerik oluşturma.

Microsoft’a göre, VALL-E öncelikle bir “nöral codec dil modeli”dir ve Meta’nın Ekim 2022’de kullanıma sunduğu EnCodec’e dayanır. dalga biçimlerinin manipüle edilmesi. Bir kişinin nasıl ses çıkardığını işler, EnCodec’i kullanarak ilgili verileri ayrı bileşenlere (“belirteçler” olarak adlandırılır) ayırır ve ardından, o sesin ötesinde başka ifadeler söylerse nasıl ses çıkarabileceğine ilişkin “bildiğini” eşleştirmek için eğitim verilerini kullanır. üç saniyelik örnek.

Microsoft, Meta’nın LibriLight ses kitaplığını kullanarak VALL-E’nin konuşma sentezi işlevlerini eğitti. Öncelikle LibriVox kamuya açık sesli kitaplardan alınan 7.000’den fazla konuşmacının 60.000 saatlik İngilizce konuşmasını içerir. VALL-E’nin iyi bir sonuç vermesi için üç saniyelik örnekteki sesin öğrenme algoritmasındaki bir sese çok benzemesi gerekir.

Amerikan teknoloji devi, yapay zeka modelinin iş başında olduğu düzinelerce sesli örnek sunuyor. VALL-E örnek web sitesi. “Konuşmacı İstemi” veri seti, taklit etmeye çalışması gereken VALL-E’ye verilen üç saniyelik sestir. “Yer Gerçeği”, aynı konuşmacının karşılaştırma amacıyla belirli bir cümleyi söyleyen önceden kaydedilmiş bir versiyonudur (deneydeki “kontrol” gibi). “Temel” örneği, geleneksel bir metinden konuşmaya sentez yöntemiyle üretilir ve “VALL-E” örneği, VALL-E modeli tarafından oluşturulur.

Microsoft araştırmacıları tarafından örnek web sitesinde gösterildiği gibi bir VALL-E blok diyagramı
Fotoğraf Kredisi: Microsoft

Araştırmacılar, bu sonuçları elde etmek için yalnızca üç saniyelik “Konuşmacı İstemi” örneğini ve bir metin dizisini (sesin söylemesini istedikleri şeyi) VALL-E’ye sağladılar. Bazı VALL-E sonuçları bilgisayar tarafından oluşturulmuş gibi görünür, ancak diğerleri, modelin amacı olan insan konuşması nedeniyle yanlış anlaşılabilir. VALL-E’nin suçları ve aldatmacayı körükleme potansiyeli nedeniyle Microsoft, VALL-E kodunu başkalarının keşfetmesi için kullanılabilir hale getirmedi. Araştırmacılar, bu teknolojinin neden olabileceği potansiyel sosyal zararın farkında gibi görünüyor.

Makalenin sonuç bölümünde şöyle yazıyorlar: “VALL-E, konuşmacı kimliğini koruyan konuşmayı sentezleyebildiğinden, modelin kötüye kullanılması durumunda, ses kimliğinin sahtekarlığı veya belirli bir konuşmacının kimliğine bürünme gibi potansiyel riskler taşıyabilir. Bu tür riskleri azaltmak mümkündür. bir ses klibinin VALL-E tarafından sentezlenip sentezlenmediğini ayırt etmek için bir algılama modeli oluşturmak. Modelleri daha da geliştirirken Microsoft AI İlkelerini de uygulamaya koyacağız.”

Ortaklık bağlantıları otomatik olarak oluşturulabilir – ayrıntılar için etik beyanımıza bakın.

CES 2023 merkezimizde Gadgets 360 ile ilgili Tüketici Elektroniği Şovundan en son haberleri alın.

Poco C55’in Yeniden Markalanmış Bir Redmi 12C Olacağı Belirtildi, Yakında Piyasaya Sürülmesi Bekleniyor

Günün öne çıkan videosu

Disney+ Hotstar Ocak 2023: Sonumuz, Taaza Khabar ve daha fazlası!

genel-8

Yazı gezinmesi

Android ve iOS için ücretsiz: Haftanın ücretsiz uygulamaları
George Hotz, yeni nesil Comma 3 eller serbest sürücü yardımı ile ‘sürüşünüzü rahatlatmak’ istiyor

Microsoft, 3 Saniyelik İstemlerden Herhangi Bir Sesi Simüle Eden Ses Yapay Zekası VALL-E’yi Tanıttı

Byteknomers

By teknomers

Benzer İçerikler

Rus medyası, devam eden kısıtlamalara rağmen sunucu ve depolama arzının yaptırım öncesi seviyelere döndüğünü iddia ediyor

Savunma girişimi True Anomaly yaklaşık %25 oranında işten çıkarıldı, yaz stajını iptal etti

Rapor, Samsung’un bir sonraki Unpacked etkinliğini 10 Temmuz’da düzenlemesi yönünde çağrıda bulunuyor

Fallout 4’ün Fiziksel Kopyaları Neredeyse Her Yerde Stokta Yok

Modern Warfare 3 Sezon 3 Reloaded çıkış tarihi

%91 puan alan fantastik taktiksel RPG, devasa yeni DLC, güncelleme ve indirim alıyor

Stellar Blade’i Ne Kadar Sürede Yenilmeli – Görev Listesi

Android 15, inatçı uygulamalarda karanlık modu zorlamanın daha iyi bir yolunu sunabilir

Google’ın muhteşem 1. çeyrek kazanç raporu, Alphabet’in ilk kez temettü ödemesine yol açtı

Threads, uygulama genelinde seçilen kelimeleri, cümleleri ve emojileri gizleme özelliğini sunuyor

Google, Pixel cihazlar için ek hata düzeltmeleri içeren Android 15 Beta 1.2’yi yayınladı

NASA Perseverance Mars Rover’ın 21. Kaya Çekirdeği

Çalışma bulguları, yakın zamanda keşfedilen kara deliğin yakındaki parçalanmış bir yıldız kümesinin parçası olduğunu ortaya çıkardı

Hubble, Küçük Halter Bulutsusu’nun Muhteşem Görünümüyle 34. Yıldönümünü Kutluyor

NASA gezgini Mars’ta fosilleşmiş yaşam aramak için umut verici bir yere ulaştı

İlginizi Çekebilir

Rus medyası, devam eden kısıtlamalara rağmen sunucu ve depolama arzının yaptırım öncesi seviyelere döndüğünü iddia ediyor

Savunma girişimi True Anomaly yaklaşık %25 oranında işten çıkarıldı, yaz stajını iptal etti

Rapor, Samsung’un bir sonraki Unpacked etkinliğini 10 Temmuz’da düzenlemesi yönünde çağrıda bulunuyor

Android 15 Beta Hakkında Şu ana Kadar Bizi Heyecanlandıran Her Şey