大規模モデルが必要な理由についてですが、私がこれまで協力してきた視覚系の分野の経験から考えると…
単純なシナリオにおける従来のアルゴリズムは、非常に効果的です。
入力が複雑で、従来のアルゴリズムでは、前後の関係やノイズを処理することが困難です。
そこで、前面に取り付けるシンプルなニューラルネットワークをフィルタとして使用すると、非常に効果があります。
大規模モデルを用いたCW(Continuous Wave)の応用により、このシステムが局所的な音声に基づいて、干渉された部分から得られる可能性のある情報を推測することができ、専門的な用途に適している可能性があります。