来源:notes/documents/07_horizon2025_whisper-small_int8_前120秒转写.md

horizon-2025 转写:Whisper-small int8(仅前 120 秒)

摘要

  • 模型:sherpa-onnx whisper-small(359MB,int8)

⚠️ 注意:本方案只覆盖 600 秒切片的前 120 秒,不是完整 600 秒原文。

方案信息

算力 CPU(RDK X5 8×Cortex-A55,无 BPU 参与)
运行时 sherpa-onnx 1.13.8(/tmp/asrvenv,Python 3.10.12)
线程 num_threads=4(串行执行,单方案独占板卡)
测试素材 horizon-2025.wavchunks/chunk-007.wav(600 秒、16kHz 单声道、中文)
纪律 所有方案串行跑,一次只跑一个模型

实测耗时(600 秒音频)

加载 解码 RTF 全量 2h35m 外推
10.2s 304.3s(仅 120 秒音频) 2.536 约 6.5 小时(无法实用)

说明:全量外推 = RTF × 9300 秒,仅按比例估算,未实测全量。

完整转写原文

以下为该方案对 600 秒切片的原始输出,未做任何校对;错别字、断句与专有名词错误均为模型原始结果。

比如说数学跟数学跟这个世界都不存在的时候当大爆还没有发生的错那个时候数学跟其实就已经存在了这个是世界背后的真相所以人工能实上是在近那个东西世界背后的这个真相所以这个里面我想跟大家又来提一个 以为常是真的吗是正的吗着时代的性来思考人工正能时代是真的吗是对的吗我觉得提这么一个观点也不一定是说求正但至少大家可以思考我们觉得AI时代人的行为数没有值地平 在过去我们从事自动其实我们也发现99%的人司机的行为是不值得学的因为他们开的真的是不好他们真的是很重你知道吗他们很多时候都我觉得不你知道有一个很有趣的一个所的结果说是还是那个反正一个北国家就就是说 人司机你要知道吗就是80%的司机为自己开的比平水平好这是不是很呀其实最近特斯拉也放出一些新嘛特斯拉实上不是用数特斯拉是自己的Fleet自己的来这个

方案特点与已知错误

  • 本方案只跑了前 120 秒chunk-007-120s.wav),未跑满 600 秒;表中 RTF 按 120 秒音频计算。
  • 中文效果最差:漏字严重,人工能实上是在近那个东西 ← 应为「人工智能实际上是在逼近那个东西」。
  • Whisper 固定 30 秒窗口 + 中文性能弱,RTF 2.536,全量外推约 6.5 小时,排除

    关联

  • 方案总览、性能对比与工程结论:note_a4def66c886144e0(https://my.feishu.cn/docx/Flj4dNQMWoB5dzxNI8mc0MmXnGb)