transcribe-matrix-live

A fork for matrix-live transcription@home by fyyd.de
git clone git://archive.git.mtrnord.blog/MTRNord/transcribe-matrix-live.git
Log | Files | Refs | README

commit f376b4009c3f3cda7927801ad0a44f5e4b91196c
parent 402974eeb783c1f198c8c924f17f83f77dd49c8f
Author: MTRNord <mtrnord1@gmail.com>
Date:   Wed,  3 Jan 2024 22:35:16 +0100

uhhhh

Diffstat:
Mtranscribe.sh | 21+++++++++++----------
1 file changed, 11 insertions(+), 10 deletions(-)

diff --git a/transcribe.sh b/transcribe.sh @@ -62,31 +62,31 @@ do done echo "normalize" -files_already_done=($(find . -wholename "./playlist_normalized/*.wav" -type f | tr '\n' ' ' | sed 's/playlist_normalized/playlist/g')) +files_already_done=($(find . -wholename "./playlist_normalized/*.wav" -type f | tr '\n' ' ' | sed -e 's/playlist_normalized/playlist/g')) files=$(find . -wholename "./playlist/*.wav" -type f | tr '\n' ' ') for already_done_file in "${files_already_done[@]}" do - files=$(echo "${files}" | sed "s@${already_done_file}@@g") + files=$(echo "${files}" | sed -e "s@${already_done_file}@@g") done -files_out=$(echo "${files}" | sed 's/playlist/playlist_normalized/g') +files_out=$(echo "${files}" | sed -e 's/playlist/playlist_normalized/g') [[ $files = *[!\ ]* ]] && python3 -m ffmpeg_normalize $files -p -o $files_out -ar 16000 ## This logic is used to not process stuff twice -#files_already_done=($(find . -wholename "./output/*.vtt" -type f | tr '\n' ' ' | sed 's/output/playlist_normalized/g' | sed 's/vtt/wav/g')) -files_already_done=($(find . -wholename "./output/*.txt" -type f | tr '\n' ' ' | sed 's/output/playlist_normalized/g'| sed 's/txt/wav/g')) +#files_already_done=($(find . -wholename "./output/*.vtt" -type f | tr '\n' ' ' | sed -e 's/output/playlist_normalized/g' | sed -e 's/vtt/wav/g')) +files_already_done=($(find . -wholename "./output/*.txt" -type f | tr '\n' ' ' | sed -e 's/output/playlist_normalized/g'| sed -e 's/txt/wav/g')) files=$(find . -wholename "./playlist_normalized/*.wav" -type f | tr '\n' ' ') for already_done_file in "${files_already_done[@]}" do - files=$(echo "${files}" | sed "s@${already_done_file}@@g") + files=$(echo "${files}" | sed -e "s@${already_done_file}@@g") done -out_files=$(echo "${files}" | sed 's/playlist_normalized/output/g' | sed 's/.wav//g') +out_files=$(echo "${files}" | sed -e 's/playlist_normalized/output/g' | sed -e 's/.wav//g') echo "starting whisper" if [[ $files = *[!\ ]* ]]; then #if ! nice -n 18 ./main -m "models/ggml-${MODEL}.bin" -t "$THREADS" -l en -ovtt -pc "${files}.wav"; #>/dev/null 2>/dev/null; - if ! nice -n 18 ./main -m "models/ggml-${MODEL}.bin" -t "$THREADS" -l en -otxt -pc --file $files --output-file $out_files -et 3.0; #>/dev/null 2>/dev/null; + if ! nice -n 18 ./main -m "models/ggml-${MODEL}.bin" -t "$THREADS" -l en -otxt -ovtt -pc --file $files --output-file $out_files -et 3.0; #>/dev/null 2>/dev/null; then echo "error transcribing" fi @@ -98,11 +98,12 @@ if [[ $files = *[!\ ]* ]]; then FILENAME=$(basename "${next_file}" ".wav") # Removes some junk from hallucination sed -i -e 's/ Subtitles by the Amara.org community//g' "./output/${FILENAME}.txt" + sed -i -e 's/Subtitles by the Amara.org community//g' "./output/${FILENAME}.vtt" - rm "./playlist/${FILENAME}.wav" + mv "./playlist/${FILENAME}.wav" "./playlist_bak/${FILENAME}.wav" rm "./playlist_normalized/${FILENAME}.wav" #rm "./${FILENAME}.vtt" - #mv "./${FILENAME}.wav.vtt" "./output/${FILENAME}.vtt" + mv "./${FILENAME}.wav.vtt" "./output/${FILENAME}.vtt" mv "./${FILENAME}.wav.txt" "./output/${FILENAME}.txt" done fi