音響テクノロジーシリーズ 29
音声器官のメカニズムとシミュレーション - 生体計測とモデル化 -
物理的計算に基づく調音と声帯振動の発声モデル,深層学習による研究についても紹介。
- 発行年月日
- 2026/09/18
- 判型
- A5 上製
- ページ数
- 280ページ
- ISBN
- 978-4-339-01168-5
定価
5,500円(本体5,000円+税)
カートに入れる
ハイパーリンク対応版あり電子版を購入
電子版を購入
- ハイパーリンク対応版Amazon Kindle(ハイパーリンク対応)
- ハイパーリンク対応版kinoppy(ハイパーリンク対応)
- VarsityWave eBooks
- 内容紹介
- まえがき
- 目次
- レビュー
- 広告掲載情報
人は発話する際,何気なくことばを話していますが,その際には,音声器官と呼ばれる肺から喉,舌,顎,唇などの臓器を非常に複雑にコントロールして音声を生み出しています.本書では,これらの音声器官がどのように音をコントロールしているのかについて,調音運動(舌や唇などによる子音や母音を作り出す動作)と,声帯振動による発声機構に分けて,詳しく解説していきます.
調音運動の計測については,2026年現在,調音音声学で主流となってきている超音波画像法とリアルタイムMRI(rtMRI)について,解析手法から実例まで,様々な観点から解説しています.また,超音波画像やMRIで計測が難しい舌筋の活動や,音の伝播,気流の乱れなどについては,模型を用いた実験や数値シミュレーションによる解析方法を詳しく解説しています.
一方,声帯振動による発声については,MRIや超音波画像では観察が難しいため,異なる手法が発展してきました.具体的には,ハイスピードカメラを用いて発声時の喉を観察したり,摘出喉頭を用いて声帯の振動を観察する方法があります.これらの計測手法について解説するとともに,計測データをもとにした声帯のシミュレーションについても詳しく解説しています.
さらに,上記の物理的な情報を用いた機械学習による最新の解析手法についても紹介しています.本書の特徴は,音や言葉の情報だけでなく,音声器官の形状や力学的特性などの物理的な情報を捉えることで,単に音声や声質の変化を記述するだけでなく,なぜそのような変化が生じるのかを物理的に説明することを目指した手法に着目している点にあります.このような手法により,音声学における方言による音の変化の説明や,構音障害・発声障害の治療への応用など,様々な分野への展開が期待できます.
また,第1章では肺から唇までの主な音声器官について,解剖学及び生理学的な説明を行なっており,計測やシミュレーションで登場する音声器官に関する用語についても,基礎から学べるようになっています.
【読者対象】
音響・音声・物理・計算力学・機械学習などの分野に興味を持つ学部4年生、大学院生、若手研究者.また、耳鼻咽喉科の音声医学に関わる医師、歯科医師、言語聴覚士などの医療従事者.ボイストレーナーなどの声を仕事とする人.
【望ましい前提知識】
大学初年級の数学、線形代数、微分積分、プログラミング経験
【書籍の特徴】
音声器官の計測事例を紹介し,その後に,計測データを用いたシミュレーションを並べることで,できるだけ想像しやすく,複雑な計算モデルもわかりやすくなるよう心がけた.また,計算モデルや模型実験について図を多く掲載することで,わかりやすくした.
【本書から得られる知識】
「音声器官が音を発する物理的なメカニズムを理解できるようになる」
「調音運動の計測・解析ができる」
「発声における声帯振動が計測・解析できる」
【実務で役立つ点】
音声学の学習者・研究者が,「なぜこのような音声の変化が起こるのか」と疑問を持った際に,本書を手に取ることで,その原因を物理的な観点から解析するための手法を学ぶことができます.また,言語聴覚士や耳鼻咽喉科・歯科に従事する医師にとっても,音声に異常のある患者に対して,どのような解析を行うことができるのかを学ぶための一助となります.
【本書キーワード】
調音音声学,超音波画像法,リアルタイムMRI,ハイスピードカメラ,数値流体力学,構造解析,PINN
音声の生成に関する研究は,記録に残る中では,1780年ごろにvon Kempelenが音声生成機械(speaking machine)を発明したのが最も古い例であり,その後19世紀にはHelmholtzによる共鳴器を用いた母音の共鳴の説明が試みられるなど,非常に古くから多くの研究者によって行われてきた。また20世紀に入ってからは,日本人研究者の活躍も広く知られている。千葉と梶山による1942年の著書“The Vowel: Its Nature and Structure”は,後のG. FantやK. N. Stevensらによる音響理論に大きな影響を与え,声帯2質点モデルを提案した石坂謙二や,声帯の詳細な観察を行った平野実らの論文は,現在でも多く引用されている。
これらの研究の共通点は,いずれも音声の物理的メカニズムに着目している点である。人が音声を発する際には,肺から気流が流れ,声帯を振動させたり,口で気流を乱れさせたりと,さまざまな物理的プロセスを経て音となり伝わっていく。またこのとき,声帯がどのように閉じるのか,舌がどのように変形するのかといった点も,生理学的だけでなく力学的に説明することができる。本書では,こうした問題を取り上げ,物理学の最も基本的なアプローチである「実験・観察」と,「理論(シミュレーション)による説明」の二面から,調音(唇・舌・喉などを動かして母音や子音といった具体的な音にすること)と声帯振動による発声について最新の研究手法を解説する。
現在,深層学習やAIと呼ばれる技術の発展により,音声生成や音声合成に多くの研究者や技術者の関心が寄せられている。大量のGPUと音声データセットをモデルに投入することで,人では聞き分けがつかないほど自然な音声が生成できるようになってきた。しかし,モデルの内部はブラックボックスであり,人がどのように喉や口を調整して自然な音声を生成しているのかを調べることはできない。一方,人の発声や調音の物理的メカニズムに基づいた知見は,器質的な発声・発話障害(器官の異常が原因で起こる声や話し方の障害)の治療には欠かせない。現に,発声障害やボイストレーニングの現場では,物理モデルによる説明が活用されている。このような背景から,本書で中心となるのは物理的な計算に基づいたモデルであり,深層学習技術および両者の融合については副次的に取り上げる。本書で紹介する研究の発展が,発音・発声を良くしたいと願う人々にさらに活かされることを望んでいる。
本書は,音響テクノロジーシリーズ14『音声生成の計算モデルと可視化』(鏑木時彦編著)と同じ分野を扱うが,2010年に発刊された前書から本書執筆までに15年が経過しており,計測装置や物理モデルは大きな発展を遂げている。
1章では,発音・発声の基礎となる音声器官の生理を解説し,2章と3章では調音運動の計測と声道のシミュレーションについて解説する。計測については,現在の研究でよく用いられている超音波画像計測とリアルタイムMRIに焦点を絞り,計測データの後処理まで丁寧に説明している。4章と5章では声帯振動による発声について,計測とシミュレーションをそれぞれ取り上げ,計測については人の声帯から類人猿の声帯,さらにシリコーン樹脂によるモデルまで広く解説する。3章と5章のシミュレーションでは,最新のスーパーコンピュータを用いた解析や機械学習による研究など幅広く紹介する。
本書の執筆は,音声科学の各分野で第一線に立つ研究者の方々にお願いした。また,各章の執筆にあたり,多数の方々から貴重なご援助をいただいた。この場を借りて,著者一同,心より感謝申し上げる。本書が音声科学に興味を持つきっかけとなり,また音声科学の進展の一助となれば幸いである。
吉永司:1章,3.1節,3.3~3.4節,4.1~4.2節,5章
竹本浩典:2.2節,3.2節
北村達也:2.1節
桂田浩一:3.5節
徳田功:4.3~4.4節
2026年7月
吉永司
1.音声器官の生理
1.1 スピーチチェイン
1.2 呼吸器の生理
1.2.1 呼吸のメカニズム
1.2.2 発話および歌声における肺気量
1.3 調音器官の生理
1.3.1 唇と顎
1.3.2 舌
1.3.3 軟口蓋と咽頭
1.3.4 喉頭蓋とその周辺器官
1.4 喉頭の生理
1.4.1 3つの軟骨
1.4.2 内喉頭筋
1.4.3 外喉頭筋
1.4.4 声帯の物性
2.調音運動の計測
2.1 超音波画像法
2.1.1 超音波画像法の基礎
2.1.2 音声研究における超音波画像法
2.1.3 超音波画像法を用いた音声研究の例
2.1.4 超音波プローブの固定法
2.1.5 舌輪郭の抽出
2.2 rtMRI
2.2.1 rtMRIの概要
2.2.2 切歯補填
2.2.3 rtMRI動画からの調音器官の輪郭抽出
2.2.4 抽出した輪郭の後処理
2.2.5 輪郭を用いた分析例
3.声道のシミュレーション
3.1 舌の有限要素モデル
3.1.1 有限要素法
3.1.2 医用画像からの舌形状の抽出
3.1.3 筋線維の配向
3.1.4 解析により得られた知見
3.1.5 舌シミュレーションの応用
3.2 音響シミュレーション
3.2.1 支配方程式
3.2.2 境界条件
3.2.3 計算条件
3.2.4 計算手順
3.2.5 計算例
3.3 口腔模型による実験
3.3.1 母音の実験
3.3.2 子音の実験
3.4 流体力学シミュレーション
3.4.1 支配方程式
3.4.2 支配方程式の性質
3.4.3 乱流モデル
3.4.4 離散化
3.4.5 境界条件と計算格子
3.4.6 計算例
3.4.7 OpenFOAMでの解析
3.5 物理情報を用いた機械学習による音の生成
3.5.1 調音運動からの音声合成で用いられる深層学習モデル
3.5.2 調音運動データからの音声合成
4.喉頭・声帯の計測
4.1 in vivoでの声帯の観察
4.1.1 喉頭内視鏡
4.1.2 EGG
4.1.3 その他の観察手法
4.2 in vivoでの空気力学的測定
4.2.1 Rothenbergマスク
4.2.2 声門下圧の測定
4.2.3 発声機能検査
4.3 in vitro摘出喉頭での測定
4.3.1 声帯振動の再現実験
4.3.2 摘出喉頭吹鳴実験
4.3.3 高速度撮影
4.4 シリコーン声帯物理モデル
4.4.1 さまざまな声帯物理モデル
4.4.2 MRI型モデルの作製法
4.4.3 MRI型モデルの吹鳴実験
5.声帯振動のシミュレーション
5.1 低次の質点モデル
5.1.1 質点モデルのバリエーション
5.1.2 喉頭筋のモデル化
5.2 有限要素モデル
5.2.1 形状と物性値
5.2.2 モード重畳法
5.2.3 モード解析による声帯振動解析
5.2.4 内喉頭筋の筋線維モデル
5.3 流体構造連成解析
5.3.1 モデルの種類
5.3.2 モデルの検証
5.3.3 流体構造連成解析の応用
5.4 機械学習モデル
5.4.1 質点モデルのパラメータ推定
5.4.2 喉頭筋活動度の推定
5.4.3 有限要素法と機械学習
5.4.4 PINN
引用・参考文献
索引
読者モニターレビュー【 竹内 朗 様 (業界・専門分野:Human speech perception, Speech quality evaluation, Automatic speech recognition, Musical instrument acoustics, 3D audio)】
本書は、人間の発声メカニズムについての専門書であるが、副題にもあるように、特に「測定」と「シミュレーション」にフォーカスした内容となっている。私の研究領域では主に音声知覚に取り組んでいるため、今回はそのメカニズムを詳しく学びたいと思ったことが、本書を手に取ったきっかけである。
全体を通して感じたことは、かなり「実践的」だということだ。測定方法の手順や使用する器具などが詳細に記されており、初学者でも順を追って理解しやすい。また、高精度な測定には高価な装置が必要になることも多いが、本書では複雑で高精度な手法だけではなく、より簡易的な手法についても取り上げられており、それぞれがこの研究分野においてどの程度の位置づけにあるのかが体系的に記述されている。全体の半分はモデリングやシミュレーションについての説明であるが、測定とシミュレーションそれぞれの強みや弱みにも言及されているため、どのような手順で実験を組み立てていくのがよいかを考える上でも、大変参考になった。
また、特筆すべき点として、図表の多さが挙げられる。ほとんどの見開きページに文章を補足する図表が掲載されている。特に、普段実際に目にすることのない発声器官の内部形状や、そもそも目に見えない音声の特徴を可視化し、その理解を助ける上で、これらの図表は大きな役割を果たしている。私自身、普段の研究でも、自分が計測・可視化したもののグラフが、本当に自分の求めているものを表しているのかを疑問に思うことがよくある。そうした際に、本書に惜しみなく掲載されている図を参考にできることは、研究を進める上で大きなアドバンテージだと言えるだろう。
構成としては、第1章が概説、2・4章がそれぞれ計測に関する記述で、3・5章がそれぞれに対応するシミュレーションとなっている。そのため、それぞれの章が独立性を保ちつつ、2・3章、4・5章が互いに補い合う構成になっている。特にシミュレーションの章でも計測に関する言及や比較があるため、実際の生体構造に基づいたシミュレーションについても理解を深めることができる。この点は初学者だけでなく、シミュレーションには慣れているものの計測の経験に乏しい研究者にとっても、知識を再確認する助けになるのではないだろうか。第5章の最後では、昨今とても注目されている機械学習についても触れられており、幅広い範囲のメソドロジーをぎゅっと凝縮した一冊になっている。
人間の音声という、身近でありながら観察することの難しいトピックではあるが、本書を通して体系的に理解することで、明日から自分の声にもっと興味を持てるようになるのではないだろうか。
読者モニターレビュー【 Mizu9673 様 (業界・専門分野:組み込み)】
本書は音声器官、音の生成に関する幅広い事柄をカバーした手引書である。
解剖学的な初歩から始まり、実験/測定の方法、シミュレーションまで、深層学習など近年の成果を交えて解説がなされている。
特に印象に残った点として以下の2点がある
1点目は第一章に記載されている、人が発声をする機構の解説である。
恥ずかしながら、私は本書を読むまで発声時の喉や筋肉、舌の動きを知らなかったが、
図解付きで解説されており、大まかな原理を知ることができた。
限られた紙面で丁寧に解説されており、私のような初学者でもこの後に必要な知識を得ることができた。
2点目は第二章、五章に記載されているシミュレーションである。
ここでは舌の材料力学的なモデルや音声の音響モデル、子音の流体力学モデル、
深層学習による発声時の声門のモデルなどが解説されている。
私は材料力学や流体力学についてあまり詳しくはないが、実際のモデルへの応用例を知ることができ、
それらの分野を学ぶモチベーションが高まったのを感じた。
まとめると、本書は広範囲の音声に関する内容をまとめた研究への入門書といえる
すべての前提知識を持つのは大変だと思うので、本書を読み進めながら周辺分野を学ぶといった使い方が良いのではと個人的に思う。
そういう意味で長期間お世話になる本だと思う。
読者モニターレビュー【 松岡 大輔 様 (業界・専門分野:プログラマー)】
本書は音声器官を計測し、シミュレートするための、具体的な手法を体系的にまとめた書籍である。技術を体系的に次代へ継承する際に、書籍が持ちうる役割は、上質な体系化を担うことである(「発刊にあたって」)という宣言の通り、「計測」「シミュレート」を軸に先行研究を体系的にまとめている。
本書は「メソッド」であるという自認(「発刊にあたって」)の通り、2章以降丁寧に方法が列挙されていく。ただ列挙するのではなく、体系的に、という点がポイントである。では、どのような観点から情報がまとめられているといえるか。軸となるのが、物理的メカニズムへの着目によって、生理学的にではなく物理的に発声のメカニズムを解明するという方法論的な選択を経た問いである。物理学的にアプローチするために、物理学の最も基本的なアプローチである「実験・観察」と「理論(シミュレーション)による説明」(「まえがき」)で情報を整理する。
この体系化の方針がシンプルかつ一貫していることによる、単なるレファレンスとは違う、体系化ということの強さがある。また、私は個人的に理論中心の研究しかしてこなかったので、物理学の実験・観察と理論の現場を垣間見て自身の研究スタイルと対比するのも興味深い。
たとえば、まずはMRIで口腔内の視覚的イメージを取得して、点成分の変動を記録する。その後、それを数理的にモデル化・シミュレートする。そして、数理的なシミュレーション結果をもとに、物理的な模型を作って実験する。実験器具のイラストがいろいろと掲載されていて、抽象的な数理が具体的な形を取るところに面白みを感じる。
このような物理学の基本的なアプローチを音声器官のメカニズムに適用して、その詳細を解明するというのが本書の問いである。あくまでも物理モデルが基本なので、機械学習による音声合成については副次的な扱いとなっている。
「上質な体系化」とはどういうことだろうか、と思って読んでみたが、本書の体系化の「上質さ」は、その軸が物理学そのものに内在しており、外から与えられたものではないという点に由来する。また、機械学習を主としては取り上げないという判断からも、著者たちの体系化の志向が読み取れる。
計測環境の選定から実験・観察の実際を経て、モデル化・シミュレーション、そして模型の作成まで、一連の工程が辿れるのは、上記の軸に沿って全工程が成立しているということであり、その意味でも本書の体系化は「上質」だといえる。たしかにこれは、書籍が他のメディアで代替しづらい部分を担っているといえるかもしれない。

-
掲載日:2026/08/28










