Upgrade to Pro — share decks privately, control downloads, hide ads and more …

完全ローカル完結のLT文字起し、要約システム

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
Avatar for numa08 numa08
August 28, 2026
53

 完全ローカル完結のLT文字起し、要約システム

Avatar for numa08

numa08

August 28, 2026

Transcript

  1. 作ったもの:全部ローカルで動く記録システム マイク VAD ASR LLM 表示 音を拾う 喋った区間だけ切り出す 日本語を文字にする 要約を育てる

    その場で出す 話者分離はしない。誰の発表かは「打刻」だけで決める 騒がしい居酒屋でのダイアライゼーションは失敗する。ボタン 1 つとマイクを手で動かすことで回避した
  2. Whisper 、使いませんでした Parakeet TDT-CTC 0.6B 日本語専用 RTF 0.01 〜 0.03

    2026 年、日本語 ASR は Whisper 一強では ない 先週 (8/18) の 11 モデル比較でも、新しいほど強いという 結果にはならなかった 5 秒の発話を 0.1 秒で処理する ReazonSpeech v2.0 Whisper は無音や雑音を食うと、存在しない文を作る 3.5 万時間の日本語で学習 MLX 変換済み Apple Silicon でそのまま動く そもそも今回は精度より速度が効く
  3. Ollama でも llama.cpp でもなく、 mlx-lm mlx-lm Apple Silicon 専用のフレームワーク 統合メモリをそのまま使う

    CPU と GPU で重みをコピーしない プロセス内に常駐できる サーバを別に立てたくなかった Ollama も llama.cpp も、別プロセスのサーバ越しになる。 ASR との実行順を自分で握れない モデルのロードは 1 回きりにしたい。 gemma-2-2b でも 51.6 秒かかる Python の変数としてモデルを持てる ASR と同じ土俵 mlx-audio と実行系を揃えられる 区間ごとに CLI を叩く構成にした時点で、この設計は成立し ない
  4. 要約モデルは、実測で選んだ モデル サイズ ロード tok/s 判定 gemma-2-2b-jpn-it 1.4GB 51.6s 19.3

    採用 Qwen2.5-3B-Instruct 1.6GB 54.5s 16.8 見送り gemma-3-4b-it 3.2GB 110.4s 12.8 却下 4B が 2B に負けた。 M1 の 68GB/s では、大きいモデルほど遅く、重く、ロードも長い
  5. 1 台の M1 に、 3 つのモデルが同居している Silero VAD Parakeet ASR

    gemma-2-2b 1.8MB 1.2GB 1.4GB CPU / 常時 GPU / 発話ごと GPU / 10 発話ごと ASR と LLM は同じ Metal GPU を奪い合う。並列化せず、逐次実行する 生音声だけは専用スレッドで書き続ける。推論がどれだけ遅れても、録音は止まらない そして、この発表もいま記録されています