iPhoneの背面3回タップで「音声→ChatGPT→Obsidian」を作ったら、2時間半かかった
今日は、思った以上の大仕事になりました。
やりたかったこと自体は、ものすごく単純です。
iPhoneの背面を3回タップする。
そのまま話す。
ChatGPTが短いタイトルをつける。
音声の本文をObsidianのInboxへ保存する。
たったこれだけです。
Xかnoteだったと思いますが、似たようなことをやっている人を見かけて、
「これは便利そうだ。自分もやってみたい」
と思ったのが始まりでした。
ところが、実際に作ってみると全然簡単ではありませんでした。
最終的にできたもの
完成した流れはこうです。
iPhone背面を3回タップ
↓
ショートカット起動
↓
音声入力
↓
ChatGPTへ音声内容を渡す
↓
短いタイトルを生成
↓
Obsidianの「00_Inbox」に新規メモ作成
↓
本文には話した内容をそのまま保存
さらに、Obsidian側では作成日も自動的に入るようにしました。
これなら、思いついた瞬間にiPhoneを取り出して、背面を3回叩いて話すだけです。
わざわざObsidianを開いて、新規ノートを作って、タイトルを書いて、本文を音声入力する必要がありません。
完成してしまえば、かなり便利です。
しかし、完成まで2時間半以上
問題は、ここにたどり着くまででした。
軽い気持ちで始めたのですが、結局2時間半以上かかりました。
途中では、
- 音声入力はできた
- Obsidianにも保存できた
- ChatGPTにも渡せた
というところまで少しずつ進むのですが、全部をつなげるとなかなか動きません。
一つ直すと、別のところがおかしくなる。
その繰り返しでした。
一番厄介だったのが文字化け
特に苦労したのが、Obsidianへ渡す本文です。
タイトルはきれいな日本語なのに、本文を見ると、
%E3%81%...
のような文字が大量に並びました。
典型的なURLエンコードです。
ショートカットからObsidianへ文章を渡す途中で、文字列をURLとして扱う必要があります。
ところが、エンコードの位置や回数を間違えると、日本語がそのまま保存されません。
最終的には、余計なURLエンコード処理を外し、Obsidianへ渡す部分に音声入力したテキストを直接指定することで正常になりました。
画面に普通の日本語が出たときは、かなりホッとしました。
音声入力が勝手に終わる問題もあった
もう一つ困ったのが、少し間を空けるだけで音声入力が終了してしまうことでした。
人間は音声メモを取るとき、
「えーっと……」
と考えることがあります。
ところが、無音を終了条件にしていると、その考えている数秒間で入力が終わってしまいます。
そこでショートカットの設定を変更して、
「停止後」ではなく「タップ時」
にしました。
これなら、自分が画面をタップするまで話し続けられます。
音声メモとしては、このほうが圧倒的に使いやすいと思います。
最後はiPhoneの「背面タップ」へ登録
ショートカットが完成した後は、
設定
→ アクセシビリティ
→ タッチ
→ 背面タップ
→ 3回タップ
と進み、作ったショートカットを割り当てました。
ここでも一つ問題がありました。
ショートカットに名前を付けていなかったのです。
一覧を見ると「URLを開く」のような名前になっていて、
「今作ったショートカットはどれだ?」
となりました。
そこで一度戻って、分かりやすい名前に変更。
再び背面3回タップへ登録して、ようやく完成しました。
「AIがあれば簡単」は、まだ少し違う
今回かなり感じたのがこれです。
AIがあれば、こういうものを作れる。
これは間違いありません。
私一人だったら、おそらく途中で諦めています。
しかし、
AIがあれば簡単に作れる
となると、まだ少し違います。
今回は途中から会話がかなり長くなりました。
するとAI側の案内も重複したり、一度直した設定をもう一度変更するような案内が出たりして、こちらも混乱しました。
「そこはもう消した」
「さっき直したところだ」
という場面が何度かありました。
AIが本当に疲労するわけではありませんが、長い作業になるほど会話の状態管理が難しくなり、人間から見ると「AIもへたってきた」ように感じるのです。
途中でスレッドを分けて、現在地を整理し直したのは正解でした。
普通の人がここまで設定できるのか
今回思ったのは、これを何の予備知識もない人が最初から最後まで自力で設定するのは、かなり難しいだろうということです。
ショートカット、変数、URL、エンコード、Obsidian URI、ChatGPT。
一つ一つはそれほど難しい技術ではありません。
しかし、複数の仕組みをつなぐと急激に難しくなる。
ここが問題です。
「背面を3回タップして話すだけ」
という完成形だけを見れば非常に簡単です。
ところが、その裏側には2時間半の設定があります。
これが今のAI・自動化の面白いところでもあり、厄介なところでもあります。
それでも作ってよかった
2時間半以上かかりましたが、結果としては大成功でした。
これからは、何か思いついたらiPhoneの背面を3回タップするだけです。
話した内容はObsidianへ入っていきます。
タイトルは後からAIに整理させてもいい。
フォルダ分けも後からAIにやらせればいい。
人間がその場でやるべきなのは、
思いついたことを逃さず残すこと。
そこだけに集中できます。
今回作ったものは小さなショートカットですが、私が作ろうとしている「第二の脳」の入口としては、かなり重要な仕組みになりそうです。
それにしても、2時間半。
SNSで見かけたときは、こんなに大変だとは思いませんでした。
AI時代になっても、最後に必要なのは案外「根気」なのかもしれません。


コメント