Приготуйтеся до появи, можливо, наймасштабнішої функції інклюзивності в історії Gboard – перетворення жестів на текст (Sign-to-Text).
Щоб дізнатись останні новини, слідкуйте за нашим каналом Google News онлайн або через застосунок.
Дослідники з Google DeepMind розробляли інструменти на базі AI для розпізнавання та інтерпретації мови жестів. У свіжому оновленні застосунку Gboard від Google помічено підготовку клавіатури до підтримки нового способу введення Sign-to-Text. Механізми захисту приватності залишають безпосередній відеопотік на самому пристрої, надсилаючи в хмарний AI від Google лише сирі дані про рухи та жести.
Читайте також: AERONAUT – про все, що літає вище землі: авіація, БПЛА та дрони, ракети та космос
Головна мета екранної клавіатури Gboard від Google полягає в тому, щоб якнайлегше трансформувати ваші думки у друковані слова на дисплеї. Для цього існує чимало зручних інструментів: від звичайного побуквеного набору й безперервного ковзання пальцем Glide до сучасного голосового введення. Однак тепер Google готується суттєво підняти планку у сфері доступності, адже Gboard вчиться сприймати мову жестів.

Автоматична трансформація жестів мови глухих у текстовий формат звучить майже як фантастика, проте завдяки прогресу в галузі машинного зору та обробки AI цей задум стає не просто реалізованим, а й цілком практичним. Торік Google DeepMind заінтригувала анонсом своєї просунутої моделі SignGemma, призначеної для зчитування жестової мови, а зараз ми спостерігаємо одне з перших ключових її застосувань на практиці.
Під час дослідження змін у версії 17.8.3.939743344-beta-arm64-v8a застосунку Gboard вдалося вперше поглянути на нову опцію введення Sign-to-Text. Хоча запустити сам інструмент у робочому режимі поки неможливо, вступне інформаційне вікно дає чітке уявлення про майбутні можливості.
Як стає зрозуміло з опису, Google застосовує гібридну локально-хмарну архітектуру: обробка відеосигналу відбувається безпосередньо на смартфоні для виокремлення сирих даних про жести, після чого ці координати передаються на сервери Google для підсумкового аналізу й формування відповідних слів. Попри певну складність такої схеми, вона забезпечує незаперечні переваги для конфіденційності, адже реальний відеозапис із користувачем нікуди не відправляється без нагальної потреби.

Хоча остаточний етап розпізнавання виконується в хмарі, залишається відкритим питання щодо можливих апаратних обмежень для смартфонів, які зможуть підтримувати функцію Sign-to-Text.
У коді застосунку також виявлено текстові підказки, покликані допомогти користувачам покращити видимість для камери, зокрема сповіщення про недостатнє освітлення з порадою перейти в більш освітлене місце: “Poor lighting. Try moving to a brighter spot.”
Попри наявність загального уявлення про принципи роботи Sign-to-Text, залишається чимало важливих запитань щодо деталей. Наприклад, дуже ймовірно, що Google відразу запропонує підтримку американської мови жестів, проте залишається невідомим долю британської чи багатьох інших регіональних жестових мов світу. Наразі точної інформації про географічне охоплення цієї функції немає.
Попри брак усіх подробиць, цей інструмент уже викликає щире захоплення. Подібні рішення для введення даних ідеально розкривають потенціал сучасних смартфонів, і той факт, що Google розробляє технологію для розширення комунікаційних можливостей людей, які цього дійсно потребують, є чудовою ініціативою. Сподіваємося, що незабаром вдасться продемонструвати цю функцію безпосередньо в дії.
Читайте також: Удар по Adobe та Canva: Google запускає генератор зображень нового покоління Pics