Google нейронна мережа може виділяти індивідуальні голоси у відео

Кров'янистий край інформатики в наші дні полягає у тому, щоб зробити комп'ютери більш схожими на людей. Ми використовуємо нейронні мережі, щоб допомогти машинам розпізнавати об'єкти, грати в ігри та навіть говорити більш реально. У рамках нового подвигу машинознавчої магії, Google Research розробила систему, яка може відтворити "ефект коктейль-партії", де ваш мозок фокусується на одному аудіо-джерелі в тісній кімнаті. Результати є вражаючими - це майже турбує так.
Google називає цю техніку "Looking to listen", оскільки вона дивиться відео з кількома динаміками, щоб розбити звук - він використовує як слухові, так і візуальні сигнали, як і ваш мозок. Також немає нічого особливого щодо цих відеороликів. Це лише відео з однією звуковою доріжкою, що складається з більш ніж однієї людини.

Щоб створити інструмент для цього, Google почав з 100 000 зразків якісних лекцій та переговорів з YouTube. Інженери рубали відео, щоб отримати сегменти чистої мови з чітко вираженими динаміками та відсутності фонового шуму. Це дало Google Research 2 000 годин відео, що складається з однієї особи, яка виступає (вони називають це набором даних AVSpeech). Хитрість полягала у використанні цих чистих зразків для створення "підроблених" коктейльних вечірок. Дослідники об'єднали відео, тому кілька людей говорили. Це дані, які Google використовувала для навчання нейронної мережі.
Як і багато інших досягнень Google Research, у цьому використовувалася сверточная нейронна мережа. Вхід до мережі складається з візуальних особливостей динаміків, а також спектрограми звукової доріжки відео. Під час обробки відео мережа дізнається, як розділити відеозапис на "частотну маску часу" для кожного динаміка. Вихідна маска узгоджується з спектрограмою аудіовходу, щоб генерувати окремі звукові доріжки.
Після завершення навчання Google розгорнула мережу на нових відео. Як ви можете бачити на прикладах Google, це працює надзвичайно добре. Модель «Шукаю слухати» може визначити, який звук походить від динаміка, і відфільтровувати все інше. Ця технологія може мати програми для відеоконференцій, слухових апаратів та відеоспостереження.
На останньому пункті ця технологія може бути настільки потужною, що неважко уявити сценарії, де його зловживають. Завдяки швидким і точно визначеним покращенням, спостерігач міг вибрати ваш голос на переповненій вулиці, щоб дізнатись, що ви сказали. Немає жодних ознак того, що Google не має наміру робити це, але це не єдине під час дослідження нейронних мереж.
Читати далі

Захистіть свою конфіденційність в Інтернеті за допомогою 5 найкращих мереж VPN
Зараз інвестування в VPN - це розумний вибір, але можливостей величезна. Щоб трохи звузити ситуацію, ми зібрали п’ять наших улюблених споживчих послуг.

Зонд Voyager 2 розмовляє з оновленою мережею NASA через 8 місяців мовчання
NASA щойно сказало "привіт" Voyager 2, і зонд відповів.

Нова мережа 4G від Verizon швидша за свою 5G
Після деяких останніх модернізацій LTE від Verizon тепер швидший, ніж його 5G.

Nokia розробляє мережу 4G на Місяці з діапазоном 5 км
За словами Тьєррі-Клейн, який керує лабораторії підприємства та промислової автоматизації в лабораторії Bell Labs, попередньо припинений космічний проект LTE дав йому головний склад, розгортання LTE на Місяці.