錄工具:免費(fèi)離線把音頻轉(zhuǎn)成文字和字幕)
Buzz 本地轉(zhuǎn)錄工具免費(fèi)離線把音頻轉(zhuǎn)成文字和字幕【免費(fèi)下載鏈接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款開源免費(fèi)的本地轉(zhuǎn)錄工具完全離線運(yùn)行。它基于 OpenAI 的 Whisper 語(yǔ)音識(shí)別模型把轉(zhuǎn)錄、翻譯和字幕生成全部放在你自己的電腦上完成——音頻不離開設(shè)備也不按時(shí)長(zhǎng)計(jì)費(fèi)。會(huì)議錄音、課程音頻、需要配字幕的視頻都能在不聯(lián)網(wǎng)的環(huán)境里處理完。它解決哪些痛點(diǎn)轉(zhuǎn)寫按分鐘計(jì)費(fèi)在線服務(wù)普遍按時(shí)長(zhǎng)收費(fèi)或要求訂閱素材一多就是一筆持續(xù)開支。Buzz 開源免費(fèi)跑多久都不產(chǎn)生額外費(fèi)用。音頻必須上傳云端訪談、會(huì)議素材往往敏感傳上第三方服務(wù)器有泄露風(fēng)險(xiǎn)。Buzz 所有處理在本地完成文件自始至終不出設(shè)備。斷網(wǎng)就不可用網(wǎng)頁(yè)版轉(zhuǎn)寫工具沒有網(wǎng)絡(luò)就停擺。Buzz 下載好模型后即可完成不聯(lián)網(wǎng)語(yǔ)音識(shí)別斷網(wǎng)環(huán)境照常工作。字幕全靠手工給視頻配字幕、斷句、打時(shí)間戳手動(dòng)做費(fèi)時(shí)費(fèi)力。Buzz 自動(dòng)產(chǎn)出帶時(shí)間戳的文本直接導(dǎo)出 SRT / VTT 字幕文件。開始前的完整準(zhǔn)備安裝按平臺(tái)分四種macOS 下載 .dmg 拖入安裝Windows 從官方下載頁(yè)拿到安裝向?qū)в捎趹?yīng)用未簽名安裝時(shí)會(huì)提示警告選擇更多信息 → 仍要運(yùn)行即可Linux 可用 flatpak 或 snap 一行命令裝好習(xí)慣命令行的話也可以pip install buzz-captions安裝需先備妥 ffmpeg 和 Python 3.12。模型需要下載一次到本地緩存在 幫助 → 偏好設(shè)置 → 模型 里能查看存放位置并一鍵下載。如果目標(biāo)機(jī)器完全不聯(lián)網(wǎng)可在有網(wǎng)的電腦上把模型緩存目錄整體拷到離線機(jī)器的相同位置Linux 為~/.cache/BuzzmacOS 為~/Library/Caches/BuzzWindows 在 AppData 下的 Buzz 緩存目錄。從文件到字幕第一次轉(zhuǎn)錄完整走一遍導(dǎo)入文件有幾種方式可選點(diǎn)工具欄的按鈕、按 CtrlOmacOS 為 CmdO、直接把文件拖進(jìn)窗口。MP3、WAV、FLAC、MP4、AVI 等常見音視頻格式都能識(shí)別。還支持 URL 導(dǎo)入——把 YouTube 視頻鏈接直接粘進(jìn)去程序會(huì)拉取音頻送入處理隊(duì)列省去先下載再導(dǎo)入的一步。導(dǎo)入后在列表里逐項(xiàng)設(shè)定任務(wù)類型轉(zhuǎn)錄或翻譯成英語(yǔ)、語(yǔ)言、模型、輸出格式隨后點(diǎn)運(yùn)行。任務(wù)進(jìn)入隊(duì)列后主界面可以并行盯住多個(gè)文件的進(jìn)度。狀態(tài)顯示已完成后雙擊該行打開轉(zhuǎn)錄窗口帶時(shí)間戳的逐句文本、播放控制、搜索都在這里也可以直接導(dǎo)出。從音頻到文本再到字幕的鏈路一次走完Whisper 字幕生成的完整價(jià)值就是在這一步兌現(xiàn)的。重點(diǎn)功能詳解說(shuō)話人識(shí)別多人對(duì)話自動(dòng)分標(biāo)簽多人對(duì)話轉(zhuǎn)錄出來(lái)是一整片文本誰(shuí)接的話容易混淆。在轉(zhuǎn)錄窗口點(diǎn)識(shí)別說(shuō)話人Buzz 會(huì)分析音頻并給每位發(fā)言者的句子打標(biāo)簽?zāi)憧梢栽嚶犇澄徽f(shuō)話人約 10 秒的片段把自動(dòng)標(biāo)簽改成真實(shí)姓名并勾選將同一人的連續(xù)句子合并為一段。會(huì)議記錄和訪談?wù)韽拇四芸闯霭l(fā)言順序與分工。字幕整形字幕長(zhǎng)度怎么調(diào)長(zhǎng)錄音直接出的字幕行長(zhǎng)短不一讀不完或跳得太快。在轉(zhuǎn)錄窗口點(diǎn)Resize設(shè)定單行最大長(zhǎng)度可選項(xiàng)包括按標(biāo)點(diǎn)重新斷句、按時(shí)間間隔合并過(guò)碎的片段如果轉(zhuǎn)錄時(shí)勾選了詞級(jí)時(shí)間戳還能逐詞重新組合并給每條字幕統(tǒng)一延長(zhǎng)顯示時(shí)長(zhǎng)。導(dǎo)出后即可得到符合各平臺(tái)規(guī)范的離線字幕文件。實(shí)時(shí)轉(zhuǎn)錄邊說(shuō)話邊出字 會(huì)議、課堂、直播往往需要即時(shí)出稿。選擇錄音任務(wù)、語(yǔ)言和麥克風(fēng)后點(diǎn)錄制屏幕隨語(yǔ)音同步出文字還能打開專門的演示窗口把轉(zhuǎn)錄內(nèi)容實(shí)時(shí)投到更大的屏幕上。需要的話接入 OpenAI 兼容接口后也能在錄制時(shí)同步翻譯成英語(yǔ)。參數(shù)調(diào)節(jié)速查參數(shù)可選項(xiàng)怎么選任務(wù)類型轉(zhuǎn)錄 / 翻譯成英語(yǔ)輸出保持原語(yǔ)言選轉(zhuǎn)錄想把法語(yǔ)、日語(yǔ)等錄音變成英文稿就選翻譯語(yǔ)言自動(dòng)檢測(cè)或手動(dòng)指定覆蓋 99 種以上語(yǔ)種事先知道語(yǔ)種時(shí)手動(dòng)指定準(zhǔn)確率通常更穩(wěn)模型tiny 到 large 多檔whisper.cpp、faster-whisper 等多后端越大越準(zhǔn)但越慢具體取舍見下文模型與硬件一節(jié)輸出格式TXT / SRT / VTT可組合勾選TXT 是純文字稿SRT 適合剪輯軟件與視頻平臺(tái)VTT 面向網(wǎng)頁(yè)播放把重復(fù)勞動(dòng)交給程序文件夾監(jiān)控在偏好設(shè)置里指定一個(gè)監(jiān)控目錄之后新放入的音頻自動(dòng)開始轉(zhuǎn)錄不用人工盯著。插件系統(tǒng)在 幫助 → 插件 中開關(guān)與排序按習(xí)慣拼裝。內(nèi)置的有AI 摘要用 OpenAI 兼容接口提煉內(nèi)容要點(diǎn)、轉(zhuǎn)錄整形轉(zhuǎn)錄后自動(dòng)把文字重組成字幕塊、跳過(guò)已轉(zhuǎn)錄重新導(dǎo)入一批文件時(shí)自動(dòng)認(rèn)出已完成項(xiàng)、增強(qiáng)語(yǔ)言檢測(cè)語(yǔ)種不明時(shí)先本地判定、導(dǎo)出 DOCX結(jié)果直接轉(zhuǎn) Word 文檔、降噪先提取人聲再轉(zhuǎn)錄嘈雜環(huán)境收益明顯。更多細(xì)節(jié)見插件文檔。命令行CLI 適合批量任務(wù)與定時(shí)腳本示例見命令行文檔buzz add --task transcribe --language zh audio.mp3 buzz add --task translate --model-type whispercpp meeting.mp3批量策略先用小模型把整批文件過(guò)一遍摸底再對(duì)關(guān)鍵文件換大模型重跑配合文件夾監(jiān)控與跳過(guò)已轉(zhuǎn)錄插件大批量素材的等待時(shí)間能省掉大半。模型與硬件怎么選大批量、實(shí)時(shí)場(chǎng)景、精度要求不高 → tiny 或 base出字最快日常課程、訪談、會(huì)議 → small 或 medium速度與精度平衡重要素材、專業(yè)內(nèi)容 → large精度最高換來(lái)更長(zhǎng)的處理時(shí)間有 NVIDIA 顯卡 → 啟用 CUDA 加速明顯縮短處理時(shí)間顯存 6GB 以上還可以選 faster-whisper無(wú)獨(dú)顯或純 CPU → 模型降一檔配合 whisper.cpp 后端Vulkan 也能調(diào)用核顯Apple Silicon 的 Mac → whisper.cpp 有深度優(yōu)化直接上手即可常見疑問(wèn)問(wèn)不聯(lián)網(wǎng)真的能完整跑起來(lái)嗎答可以。轉(zhuǎn)錄與字幕生成全部在本地進(jìn)行只有選用 OpenAI API 后端或 AI 摘要插件時(shí)才需要網(wǎng)絡(luò)。模型緩存目錄可以提前從別的機(jī)器拷過(guò)來(lái)內(nèi)網(wǎng)隔離環(huán)境也能用。問(wèn)模型下載不完整、程序出問(wèn)題了怎么辦答先到 幫助 → 偏好設(shè)置 → 模型 里刪除對(duì)應(yīng)文件重新下載項(xiàng)目還附帶模型下載腳本方便一次性備齊離線模型包。問(wèn)轉(zhuǎn)錄太慢有辦法嗎答三條路換更小的模型、改用 whisper.cpp 或 faster-whisper 這類更快的后端或者在偏好設(shè)置里配置 OpenAI API讓遠(yuǎn)程服務(wù)器承擔(dān)計(jì)算。問(wèn)幾小時(shí)的錄音能處理嗎答沒有硬性時(shí)長(zhǎng)上限幾秒到幾小時(shí)的素材都在處理范圍內(nèi)任務(wù)隊(duì)列支持多個(gè)文件并行排隊(duì)。問(wèn)想第一時(shí)間用上最新功能和修復(fù)答官方發(fā)布渠道會(huì)同步開發(fā)版本保持更新習(xí)慣即可。寫在最后Buzz 把把聲音變文字從一項(xiàng)按分鐘計(jì)費(fèi)的在線服務(wù)變成了一臺(tái)電腦上免費(fèi)、離線、完全可控的能力模型在本地跑結(jié)果隨手導(dǎo)出流程隨時(shí)可查。如果手頭正堆著待整理的錄音不妨現(xiàn)在導(dǎo)入一個(gè)文件跑完你的第一個(gè)轉(zhuǎn)錄任務(wù)。【免費(fèi)下載鏈接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/buz/buzz創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考