Google DeepMindが、日本国内での研究開発の取り組みを東京拠点のプリンシパルサイエンティスト、全炳河(ぜん・へいが)氏の説明を通じて公開しました。東京拠点は2018年設立のGoogle Brain Japanを前身とし、2023年のDeepMindとGoogle Brainの統合を経て2025年に正式にGoogle DeepMindの拠点として位置づけられたとしています。基盤モデルやアルゴリズムといった「横断型」の研究と、教育・医療・ゲームなど特定分野に絞った「縦断型」の研究の両輪で開発を進めているといいます。
音声分野では、Geminiの音声処理において、音声波形を一度テキストに変換する従来方式ではなく、波形を直接「音声トークン」に変換するマルチモーダルな方式を採用していると説明されています。話者の抑揚や感情といったニュアンスを保ったまま、途切れの少ないリアルタイムな音声対話を実現することを狙っているとのことです。
少子高齢化という日本固有の社会課題への取り組みとしては、介護現場のスタッフの発話を認識し、その日のケア記録を自動的に整理されたテキストへと変換する「ケア記録アシスト」を紹介。記録作成にかかる時間を減らし、本来の介護業務によりリソースを割けるようにすることを目指しているといいます。
またゲーム分野では、3D仮想空間内で自然言語の指示に従って自律的に行動するAIエージェント「SIMA」の開発も進行中だとしています。「建物まで行ってアイテムを取ってきて」といった曖昧な指示を理解し、視覚情報とコントローラー操作を結び付けて、未知のゲーム環境にも適応できる汎用性を示しているとしています。



