ソニフィケーションはじめの一歩
!!!この記事には音楽ではなくソニフィケーションという手法によるノイズのような音源を掲載しています。急なノイズに驚かないよう音量にはご注意ください。!!!
ソニフィケーションって知ってる?
画像を音に変換したら楽しいのではないか?——それがこの記事の出発点でした。
早速アプリの制作を生成AIに頼んでみると、こういった発想で音を作ることを「ソニフィケーション」と呼ぶのだと知りました。
ソニフィケーション(Sonification)とは、数値や画像、動きなどの情報を音に変換して表現する技術です。データの変化を音の高さ、音量、音色、リズムなどに対応させることで、視覚だけでは捉えにくい特徴やパターンを聴覚的に理解できるようにします。科学研究や医療、データ分析などに利用されるほか、画像や自然現象を音楽的に表現するアート作品にも応用されています。 (ChatGPT)
こういう場合、先行事例を学ぶのが順当かと思いつつも、今すぐ音に変換してみたいという好奇心が勝り、とにもかくにもアプリを作って動かしてみることにしました。
アプリの開発環境はPythonを選び、生成AIと対話しながら制作しました。特につまずくポイントもなく、あっさりとアプリができあがり、動作確認。
最初はカラーパターンのグラフィック画像を音にしてみました。
聴いてみると複雑な音の羅列で、ノイズや不協和音のようでもあり、昔のアナログモデムの接続音とベクトルが似ていると感じました。
様々な画像を音に変換
「これがソニフィケーションか!」と勝手に手応えを感じ、手持ちの画像をいくつか変換してみました。
以下が実際の音源です。アプリから出力されたデータをそのままアップロードしています。
かなりドギツイ音ですが、どんな印象を持たれましたか?宇宙人からのメッセージ?、ホラー映画の不協和音?「なんじゃこりゃ!」と思われた方もいるかもしれません。
今回の変換の仕組みを解説
それではここで、今回使ったアプリの仕組みを簡単に説明します。
画像は左から右へスキャンする仕組みにしています。明るさが音量とリンクしているので、暗い画像は音が小さかったり無音になります。色は音色や左右の定位に影響を与えます。音色の元になる波形は、サイン波、三角波、ノコギリ波の3種類が使われ、それぞれ光の三原色のR(赤)・G(緑)・B(青)の各成分に対応する仕組みです。定位の方は色相から変換しています。同じ色相が続くと左右の位置も一定になる傾向があります。
また、音高ですが、画像をスキャンする際、縦方向に1列ずつ読み取り、その中から明るい部分をピックアップします。そのときのY座標(明るい部分が画像の上下のどの辺にあるか)が音の高さに対応しています。そのため画像の中の明るい部分が優先的に音に変換される仕様になっています。
他にもFM変調などの要素があり、ChatGPT自身の解説によると以下のようにまとめることができます。
- 横方向の位置 → 音が鳴る時間
- 縦方向の位置 → 音の高さ
- 明るさ → 音量と発音するかどうか
- RGBの割合 → 基本となる波形・音色
- 彩度 → 倍音やFM変調の強さ
- 色相 → FM変調の性質とステレオ定位
グラニュラーシンセで加工し25秒のサウンドクリップに
ここまででソニフィケーションの最初の一歩を踏み出した訳ですが、音に少し物足りなさを感じたので、加工を加えてみることにしました。
これまた生成AIと共に以前開発したグラニュラーシンセを使って、ループ処理、エフェクト処理などの加工を施し、8秒の音源を25秒に引き伸ばしてみます。こちらがその処理後の音です。
幾分音に丸みも出て聴きやすくなっているのがお分かりいただけるかと思います。
まとめ
今回はソニフィケーションはじめの一歩といことで、画像を音に変換し、25秒のサウンドクリップにまとめるというところまでやってみました。
今後、効果音や音楽にも活用できるような形に発展させていければと考えています。


