在瀏覽器裡把影音檔聽寫成字幕
選一個本機的影音檔,辨識全程在這個分頁裡跑完,輸出可逐句校對的 SRT。中文結果會轉成台灣用語繁體。
PRIVACY檔案不會離開這台裝置。沒有上傳、沒有後端、沒有任何伺服器看得到你的音訊;本頁唯一會對外連線的動作是下載模型。
LANGUAGE選你講最多的那個語言。辨識本身不會翻譯——選日文就得到日文字幕。夾雜其他語言的段落,Whisper 有時照實轉出、有時整段丟掉,實測兩次結果不同,不能指望。「自動偵測」更糟:它替整個檔案挑一個語言,其他語言的段落全部消失,所以不是預設值。要讓非中文的句子也變成中文,把右邊的「輸出」改成翻譯。
MODEL首次使用需要下載模型(whisper-large-v3-turbo,約 700 MB),之後由瀏覽器快取,斷網也能再用。要換裝置或清了瀏覽器資料就得重下。
TRANSLATE把「輸出」改成翻譯,會再下載一個翻譯模型(NLLB-200-distilled-600M,約 850 MB)。兩個模型不能同時待在記憶體裡,所以翻譯前會先卸掉辨識模型,下一次辨識要重新載入。翻譯是逐句進行的,每句約 5 秒。
SPEED有 WebGPU 的瀏覽器跑得動;沒有的話會退到單執行緒 WASM,會非常慢。GitHub Pages 送不出 COOP/COEP header,多執行緒 WASM 在這裡開不起來。另外第一次辨識要先編譯 GPU shader,會比之後每一次多等一段時間。
ACCURACY機器辨識一定有錯字,專有名詞尤其容易錯。時間軸照模型給的,這頁只讓你改文字。匯出前請自己看過一遍。
辨識引擎
whisper-large-v3-turbo按下載入才會開始下載模型。想先確認裝置能不能跑,這一步就會告訴你。
選擇檔案
音訊 · 影片影片檔交給瀏覽器解碼取出音軌,能不能解開要看這台裝置支援哪些編碼;解不開會直接告訴你,請先自行轉成音訊檔再丟進來。語言預設中文,丟其他語言的檔案要自己改。實測一段中→英→中→英的錄音:指定中文那次 11 句、中英都在,但換一段素材重跑,英文就整段不見了;改成自動偵測則只剩 2 句、中文全部消失。要穩定拿到中文字幕就開翻譯。
逐句結果
0 句還沒有結果。