發帖者在 HAM 語音辨識方面取得了一項進展,但我嘗試後覺得辨識效果還有提升空間。
感覺可以參考論壇中「SSB Runner」的想法,製作一些數據來強化語音辨識的效果:利用LLM生成通用的底稿,使用TTS合成語音,透過Python小工具加入隨機的QRN、QSB等干擾模式,並建立一個一定規模的合成數據集來提升辨識能力。
以下這個連線的一些困難點:
- 透過適當的策略,讓 LLM 產生多樣化的通用草稿。
- 如何讓 TTS 生成的語音符合愛好者的通訊習慣(例如 Yaesu 等品牌的使用方式、ICAO 字母解釋法、信號報告以及 Western Union 92 碼的不同讀法)?
- 如何使 QRN 和 QSB 與實際的干擾衰減模型相符?
大致思考了一下,覺得可能存在一些潛在的解決方案,看看是否有其他人願意依照這個方向進一步發展。