0:00.000–0:01.656
ja这是Handy,
0:01.656–0:05.589
ja它是一款开源的语音识别和语音听写应用。
0:05.589–0:07.038
ja完全离线运行,
0:07.038–0:08.073
ja没有云端,
0:08.073–0:09.108
ja没有订阅,
0:09.108–0:10.350
ja也不用账号。
0:10.350–0:13.662
ja你还可以自己选择喜欢的听写模型。
0:13.662–0:14.491
ja老师说,
0:14.491–0:19.252
ja我觉得它现在已经成了我最喜欢的语音转文字工具。
0:19.252–0:20.908
ja所以这七视频里,
0:20.908–0:23.185
ja我们会看看Handy。
0:23.185–0:25.255
ja了解它是怎么工作的,
0:25.255–0:26.704
ja再做几项测试,
0:26.704–0:28.360
ja看看它表现如何。
0:28.360–0:34.915
ja以及和商业版Whisper Flow这类重量级产品比起来怎么样。
0:34.915–0:36.184
ja会很有意思,
0:36.184–0:37.664
ja那我们开始吧。
0:37.664–0:38.933
ja到目前为止,
0:38.933–0:42.104
ja我一直对语音听写应用有点怀疑,
0:42.104–0:45.487
ja而且一直找不到一款我真心想用的。
0:45.487–0:49.505
ja我不想用任何商业产品来付费做语音转写。
0:49.505–0:50.985
ja而且我也担心,
0:50.985–0:56.060
ja用一个本地语音转写模型的开源工具会把CPU占满。
0:56.060–1:00.360
ja不过,Handy其实把这两个顾虑都打消了。
1:00.360–1:03.842
ja先说说Handy到底是怎么构建的,
1:03.842–1:05.480
ja又是怎么工作的。
1:06.440–1:10.315
jaHandy由开发者CJ Pace和Terry一起开发。
1:10.315–1:11.805
ja后端用的是Rust。
1:11.805–1:15.680
ja上层的设置界面则用React和TypeScript。
1:15.680–1:25.400
enTranscribe CPP负负责运行Whisper系列模型。格式是GGM和GGY。Transcribe RS运行的是ParaKit。
1:26.100–1:31.620
jaCPAL负责跨平台音频输入。RDV负责全局键盘快捷键。
1:32.500–1:38.000
ja它还用到一个叫Roboto的Core。提供实时音频流和重采样。
1:38.000–1:40.808
ja这个组合让它用起来特别简单,
1:40.808–1:42.011
ja也特别清亮。
1:42.011–1:45.420
ja连在我的MacBook上都很轻松。
1:47.100–1:49.580
ja从用户角度看,整个流程也很简单。
1:50.340–1:53.460
ja你先设一个自定义快捷键,然后可以切缓开关。
1:54.340–1:56.360
ja或者长按来实现Push to Talk。
1:57.360–2:00.320
ja按住的时候,Colero VAD会在后台悄悄过滤掉静音。
2:00.320–2:03.720
ja这样就不会白白消耗算力去转写整段空白。
2:04.560–2:08.160
ja松开后,Handy会把音频发给你选定的模型。
2:09.200–2:13.640
ja再把转写结果直接粘贴到当时当前聚焦的输入框里。
2:14.660–2:16.460
jaHandy并不是这方面独有的。
2:17.400–2:21.460
ja市面上还有不少语音转写应用也差不多是这种工作方式。
2:22.160–2:25.680
ja不过我最喜欢的是你可以自己选喜欢的模型。
2:26.340–2:29.900
ja模型列表里的每个模型都有速度和准确率的指标。
2:30.320–2:33.440
ja这有点像在Mario Kart里选自己最喜欢的角色。
2:34.160–2:36.440
ja你可以决定哪项指标对你来说最重要。
2:36.940–2:42.180
ja对我来说,我发现用ParaKit Unify 0,6BP模型就很好用。
2:42.840–2:46.980
ja因为ParaKit是一个CPU1模型,而且按他们自己的数据。
2:47.700–2:50.640
ja它在终端爱武芯片上的运行速度大约是5倍10时。
2:51.200–2:53.300
ja我的MR Max远远超过这个Page。
2:53.960–2:56.820
ja所以我把它放在后台跑的时候甚至都感觉不到。
2:57.620–2:59.580
ja而且可选项真的很多。
2:59.580–3:02.920
ja它们甚至还有专门针对某一种的模型。
3:03.880–3:07.200
ja比如我们有一些俄语版本,还有一些乌克兰语版本。
3:08.000–3:10.240
ja我很喜欢嗨这句使命宣言里的坦诚。
3:11.020–3:13.440
jaHandy不是想成为最好的语音转文字应用,
3:14.120–3:16.280
ja而是想成为最容易二次开发的那个。
3:17.060–3:20.063
ja而且你甚至可以把自己微调过的Whisper G
3:20.063–3:23.340
jaGmail模型放进App的Models文件夹里。
3:23.340–3:28.200
ja重启之后,它就会直接作为一个自定义选项出现。
3:29.180–3:34.340
ja我觉得,如果任何时候要我在Handy和Whisper Flow之间选,
3:35.360–3:39.200
ja我会选Handy,最大的原因就是它可以离线运行。
3:40.160–3:42.980
ja你不需要注册账号,也没有订阅费。
3:42.980–3:48.540
ja而且我很确定,所有我的语音输入音频样本都会留在我的机器上,
3:49.200–3:51.220
ja不会被偷偷拿去训练别的语音模型。
3:51.680–3:52.900
ja所以我真的很高兴。
3:53.640–3:56.460
ja现在有了这样一个MIT许可的语音输入工具。
3:57.180–3:58.440
ja听起来都很棒,不过,
3:59.240–4:02.740
ja我们就来实际测试一下Pandy,看看它表现如何。
4:03.620–4:08.860
ja我会把Handy的表现和Whisper Flow以及Google自家的转写服务做个对比。
4:12.980–4:20.940
ja后者也可以在Google Docs里用。
4:26.120–4:30.120
ja哦,昨天我去买了点菜,回家路上突然想起来。
4:35.120–4:42.060
ja我得回头把我的SQLite数据库接到一个运行在我自定义GPU集群上的Cobot服务上。
4:42.980–4:56.640
ja我能想到的一个办法是用一个叫Grog的LLM。
4:58.540–5:01.220
ja另外还从CheckGPT得到了一些帮助。
5:01.860–5:08.060
ja最后,我们做出了一个能运行的应用,但过程真的很折腾。
5:08.060–5:12.140
ja我们把这两部分分开来说。
5:12.820–5:18.640
ja你看,这里的Google语音输入服务要差很多,它不会加标点。
5:20.320–5:24.280
ja也不知道怎么分句,它把Cobot识别错了。
5:25.660–5:27.780
jaSQLite数据库也识别错了。
5:27.780–5:31.440
ja甚至连LLM这个词都没认出来。
5:32.080–5:33.440
ja它以为Grog是Rock。
5:35.200–5:39.120
ja这个我最喜欢,它还把ChatGPT认成了ChatGPT。
5:40.800–5:41.940
enChatGPT不错。
5:42.660–5:45.700
ja嗯,所以你能明显看出来Handy好多了。
5:45.700–5:50.140
ja因为它有标点,还能识别一些特定术语。
5:51.660–5:54.300
ja而且大多数技术术语都认对了。
5:55.440–5:58.640
ja现在我们也来把这个结果和Whisper Flow比一下。
6:02.380–6:06.200
ja我要尽量把同样的文本重复的尽可能接近。
6:06.200–6:09.980
ja公平地测试一下。
6:11.080–6:13.140
ja嗯,昨天我去买了些杂货。
6:13.840–6:14.760
ja回来的路上。
6:16.180–6:18.240
ja我突然想起我得回家。
6:19.580–6:25.520
ja把我的SQLite数据库接到一个运行在我自定义GPU集群上的Cobot服务上。
6:30.380–6:33.820
ja我其实不知道该怎么做,所以只好找人帮忙。
6:33.820–6:37.100
ja我能想到的唯一能帮上忙的工具。
6:37.780–6:39.440
ja是一个叫Grook的LLM。
6:40.340–6:43.620
ja后来,我也从ChatGPT那里得到了一点帮助。
6:44.660–6:48.620
ja最后,我们是把应用跑起来了,但过程真的很折腾。
6:49.660–6:53.420
ja好吧,你可以清楚地看到Whisper Flow做得最好。
6:54.420–6:58.120
ja它把句子分得很准确,而且所有术语都没出错。
6:59.180–7:03.420
ja毕竟这是商业产品,你会以为它会比开源工具更好。
7:03.820–7:09.400
ja但说实话,这个结果和Whisper Flow之间并没有那么大差别。
7:10.340–7:14.520
ja所以,我还是更喜欢用Handy,因为它免费、私密。
7:15.480–7:16.440
ja而且是开源的。
7:16.440–7:19.940
ja不过,Whisper Flow在这里确实做得很不错。
7:20.980–7:24.320
ja所以总的来说,它还是一个很靠谱的服务。
7:25.460–7:27.500
ja好了,各位,概括来说就是这样。
7:27.960–7:29.240
ja这个功能确实很实用。
7:29.940–7:31.240
ja我刚才真不是开玩笑。
7:32.020–7:34.680
ja说它已经成了我最喜欢的语音听写工具。
7:34.680–7:37.840
ja我甚至有点担心,要是我用得太频繁。
7:38.600–7:40.960
ja自己可能都会忘了怎么用键盘打字。
7:41.700–7:43.720
ja不过,这只是我的个人看法和观察。
7:44.500–7:45.900
ja那你觉得Handy怎么样?
7:46.460–7:47.300
ja你是过了吗?
7:47.800–7:48.500
ja你会用吗?
7:49.360–7:51.200
ja欢迎在下方评论区告诉我们。
7:51.760–7:54.880
ja各位,如果你喜欢这类技术解析,
7:55.200–7:57.200
ja也请在视频下方点个赞。
7:57.200–8:00.940
ja让我知道,别忘了订阅我们的频道。
8:01.820–8:03.460
en我是BetterStack的Andreas,
8:03.780–8:05.020
ja我们下期视频再见。
8:06.120–8:06.560
ja音乐
0:00.000–0:01.656
这是Handy,
0:01.656–0:05.589
它是一款开源的语音识别和语音听写应用。
0:05.589–0:07.038
完全离线运行,
0:07.038–0:08.073
没有云端,
0:08.073–0:09.108
没有订阅,
0:09.108–0:10.350
也不用账号。
0:10.350–0:13.662
你还可以自己选择喜欢的听写模型。
0:13.662–0:14.491
老师说,
0:14.491–0:19.252
我觉得它现在已经成了我最喜欢的语音转文字工具。
0:19.252–0:20.908
所以这七视频里,
0:20.908–0:23.185
我们会看看Handy。
0:23.185–0:25.255
了解它是怎么工作的,
0:25.255–0:26.704
再做几项测试,
0:26.704–0:28.360
看看它表现如何。
0:28.360–0:34.915
以及和商业版Whisper Flow这类重量级产品比起来怎么样。
0:34.915–0:36.184
会很有意思,
0:36.184–0:37.664
那我们开始吧。
0:37.664–0:38.933
到目前为止,
0:38.933–0:42.104
我一直对语音听写应用有点怀疑,
0:42.104–0:45.487
而且一直找不到一款我真心想用的。
0:45.487–0:49.505
我不想用任何商业产品来付费做语音转写。
0:49.505–0:50.985
而且我也担心,
0:50.985–0:56.060
用一个本地语音转写模型的开源工具会把CPU占满。
0:56.060–1:00.360
不过,Handy其实把这两个顾虑都打消了。
1:00.360–1:03.842
先说说Handy到底是怎么构建的,
1:03.842–1:05.480
又是怎么工作的。
1:06.440–1:10.315
Handy由开发者CJ Pace和Terry一起开发。
1:10.315–1:11.805
后端用的是Rust。
1:11.805–1:15.680
上层的设置界面则用React和TypeScript。
1:15.680–1:25.400
Transcribe CPP负负责运行Whisper系列模型。格式是GGM和GGY。Transcribe RS运行的是ParaKit。
1:26.100–1:31.620
CPAL负责跨平台音频输入。RDV负责全局键盘快捷键。
1:32.500–1:38.000
它还用到一个叫Roboto的Core。提供实时音频流和重采样。
1:38.000–1:40.808
这个组合让它用起来特别简单,
1:40.808–1:42.011
也特别清亮。
1:42.011–1:45.420
连在我的MacBook上都很轻松。
1:47.100–1:49.580
从用户角度看,整个流程也很简单。
1:50.340–1:53.460
你先设一个自定义快捷键,然后可以切缓开关。
1:54.340–1:56.360
或者长按来实现Push to Talk。
1:57.360–2:00.320
按住的时候,Colero VAD会在后台悄悄过滤掉静音。
2:00.320–2:03.720
这样就不会白白消耗算力去转写整段空白。
2:04.560–2:08.160
松开后,Handy会把音频发给你选定的模型。
2:09.200–2:13.640
再把转写结果直接粘贴到当时当前聚焦的输入框里。
2:14.660–2:16.460
Handy并不是这方面独有的。
2:17.400–2:21.460
市面上还有不少语音转写应用也差不多是这种工作方式。
2:22.160–2:25.680
不过我最喜欢的是你可以自己选喜欢的模型。
2:26.340–2:29.900
模型列表里的每个模型都有速度和准确率的指标。
2:30.320–2:33.440
这有点像在Mario Kart里选自己最喜欢的角色。
2:34.160–2:36.440
你可以决定哪项指标对你来说最重要。
2:36.940–2:42.180
对我来说,我发现用ParaKit Unify 0,6BP模型就很好用。
2:42.840–2:46.980
因为ParaKit是一个CPU1模型,而且按他们自己的数据。
2:47.700–2:50.640
它在终端爱武芯片上的运行速度大约是5倍10时。
2:51.200–2:53.300
我的MR Max远远超过这个Page。
2:53.960–2:56.820
所以我把它放在后台跑的时候甚至都感觉不到。
2:57.620–2:59.580
而且可选项真的很多。
2:59.580–3:02.920
它们甚至还有专门针对某一种的模型。
3:03.880–3:07.200
比如我们有一些俄语版本,还有一些乌克兰语版本。
3:08.000–3:10.240
我很喜欢嗨这句使命宣言里的坦诚。
3:11.020–3:13.440
Handy不是想成为最好的语音转文字应用,
3:14.120–3:16.280
而是想成为最容易二次开发的那个。
3:17.060–3:20.063
而且你甚至可以把自己微调过的Whisper G
3:20.063–3:23.340
Gmail模型放进App的Models文件夹里。
3:23.340–3:28.200
重启之后,它就会直接作为一个自定义选项出现。
3:29.180–3:34.340
我觉得,如果任何时候要我在Handy和Whisper Flow之间选,
3:35.360–3:39.200
我会选Handy,最大的原因就是它可以离线运行。
3:40.160–3:42.980
你不需要注册账号,也没有订阅费。
3:42.980–3:48.540
而且我很确定,所有我的语音输入音频样本都会留在我的机器上,
3:49.200–3:51.220
不会被偷偷拿去训练别的语音模型。
3:51.680–3:52.900
所以我真的很高兴。
3:53.640–3:56.460
现在有了这样一个MIT许可的语音输入工具。
3:57.180–3:58.440
听起来都很棒,不过,
3:59.240–4:02.740
我们就来实际测试一下Pandy,看看它表现如何。
4:03.620–4:08.860
我会把Handy的表现和Whisper Flow以及Google自家的转写服务做个对比。
4:12.980–4:20.940
后者也可以在Google Docs里用。
4:26.120–4:30.120
哦,昨天我去买了点菜,回家路上突然想起来。
4:35.120–4:42.060
我得回头把我的SQLite数据库接到一个运行在我自定义GPU集群上的Cobot服务上。
4:42.980–4:56.640
我能想到的一个办法是用一个叫Grog的LLM。
4:58.540–5:01.220
另外还从CheckGPT得到了一些帮助。
5:01.860–5:08.060
最后,我们做出了一个能运行的应用,但过程真的很折腾。
5:08.060–5:12.140
我们把这两部分分开来说。
5:12.820–5:18.640
你看,这里的Google语音输入服务要差很多,它不会加标点。
5:20.320–5:24.280
也不知道怎么分句,它把Cobot识别错了。
5:25.660–5:27.780
SQLite数据库也识别错了。
5:27.780–5:31.440
甚至连LLM这个词都没认出来。
5:32.080–5:33.440
它以为Grog是Rock。
5:35.200–5:39.120
这个我最喜欢,它还把ChatGPT认成了ChatGPT。
5:40.800–5:41.940
ChatGPT不错。
5:42.660–5:45.700
嗯,所以你能明显看出来Handy好多了。
5:45.700–5:50.140
因为它有标点,还能识别一些特定术语。
5:51.660–5:54.300
而且大多数技术术语都认对了。
5:55.440–5:58.640
现在我们也来把这个结果和Whisper Flow比一下。
6:02.380–6:06.200
我要尽量把同样的文本重复的尽可能接近。
6:06.200–6:09.980
公平地测试一下。
6:11.080–6:13.140
嗯,昨天我去买了些杂货。
6:13.840–6:14.760
回来的路上。
6:16.180–6:18.240
我突然想起我得回家。
6:19.580–6:25.520
把我的SQLite数据库接到一个运行在我自定义GPU集群上的Cobot服务上。
6:30.380–6:33.820
我其实不知道该怎么做,所以只好找人帮忙。
6:33.820–6:37.100
我能想到的唯一能帮上忙的工具。
6:37.780–6:39.440
是一个叫Grook的LLM。
6:40.340–6:43.620
后来,我也从ChatGPT那里得到了一点帮助。
6:44.660–6:48.620
最后,我们是把应用跑起来了,但过程真的很折腾。
6:49.660–6:53.420
好吧,你可以清楚地看到Whisper Flow做得最好。
6:54.420–6:58.120
它把句子分得很准确,而且所有术语都没出错。
6:59.180–7:03.420
毕竟这是商业产品,你会以为它会比开源工具更好。
7:03.820–7:09.400
但说实话,这个结果和Whisper Flow之间并没有那么大差别。
7:10.340–7:14.520
所以,我还是更喜欢用Handy,因为它免费、私密。
7:15.480–7:16.440
而且是开源的。
7:16.440–7:19.940
不过,Whisper Flow在这里确实做得很不错。
7:20.980–7:24.320
所以总的来说,它还是一个很靠谱的服务。
7:25.460–7:27.500
好了,各位,概括来说就是这样。
7:27.960–7:29.240
这个功能确实很实用。
7:29.940–7:31.240
我刚才真不是开玩笑。
7:32.020–7:34.680
说它已经成了我最喜欢的语音听写工具。
7:34.680–7:37.840
我甚至有点担心,要是我用得太频繁。
7:38.600–7:40.960
自己可能都会忘了怎么用键盘打字。
7:41.700–7:43.720
不过,这只是我的个人看法和观察。
7:44.500–7:45.900
那你觉得Handy怎么样?
7:46.460–7:47.300
你是过了吗?
7:47.800–7:48.500
你会用吗?
7:49.360–7:51.200
欢迎在下方评论区告诉我们。
7:51.760–7:54.880
各位,如果你喜欢这类技术解析,
7:55.200–7:57.200
也请在视频下方点个赞。
7:57.200–8:00.940
让我知道,别忘了订阅我们的频道。
8:01.820–8:03.460
我是BetterStack的Andreas,
8:03.780–8:05.020
我们下期视频再见。
8:06.120–8:06.560
音乐
0:00.000–0:01.656
ja这是Handy,
这是Handy,
0:01.656–0:05.589
ja它是一款开源的语音识别和语音听写应用。
它是一款开源的语音识别和语音听写应用。
0:05.589–0:07.038
ja完全离线运行,
完全离线运行,
0:07.038–0:08.073
ja没有云端,
没有云端,
0:08.073–0:09.108
ja没有订阅,
没有订阅,
0:09.108–0:10.350
ja也不用账号。
也不用账号。
0:10.350–0:13.662
ja你还可以自己选择喜欢的听写模型。
你还可以自己选择喜欢的听写模型。
0:13.662–0:14.491
ja老师说,
老师说,
0:14.491–0:19.252
ja我觉得它现在已经成了我最喜欢的语音转文字工具。
我觉得它现在已经成了我最喜欢的语音转文字工具。
0:19.252–0:20.908
ja所以这七视频里,
所以这七视频里,
0:20.908–0:23.185
ja我们会看看Handy。
我们会看看Handy。
0:23.185–0:25.255
ja了解它是怎么工作的,
了解它是怎么工作的,
0:25.255–0:26.704
ja再做几项测试,
再做几项测试,
0:26.704–0:28.360
ja看看它表现如何。
看看它表现如何。
0:28.360–0:34.915
ja以及和商业版Whisper Flow这类重量级产品比起来怎么样。
以及和商业版Whisper Flow这类重量级产品比起来怎么样。
0:34.915–0:36.184
ja会很有意思,
会很有意思,
0:36.184–0:37.664
ja那我们开始吧。
那我们开始吧。
0:37.664–0:38.933
ja到目前为止,
到目前为止,
0:38.933–0:42.104
ja我一直对语音听写应用有点怀疑,
我一直对语音听写应用有点怀疑,
0:42.104–0:45.487
ja而且一直找不到一款我真心想用的。
而且一直找不到一款我真心想用的。
0:45.487–0:49.505
ja我不想用任何商业产品来付费做语音转写。
我不想用任何商业产品来付费做语音转写。
0:49.505–0:50.985
ja而且我也担心,
而且我也担心,
0:50.985–0:56.060
ja用一个本地语音转写模型的开源工具会把CPU占满。
用一个本地语音转写模型的开源工具会把CPU占满。
0:56.060–1:00.360
ja不过,Handy其实把这两个顾虑都打消了。
不过,Handy其实把这两个顾虑都打消了。
1:00.360–1:03.842
ja先说说Handy到底是怎么构建的,
先说说Handy到底是怎么构建的,
1:03.842–1:05.480
ja又是怎么工作的。
又是怎么工作的。
1:06.440–1:10.315
jaHandy由开发者CJ Pace和Terry一起开发。
Handy由开发者CJ Pace和Terry一起开发。
1:10.315–1:11.805
ja后端用的是Rust。
后端用的是Rust。
1:11.805–1:15.680
ja上层的设置界面则用React和TypeScript。
上层的设置界面则用React和TypeScript。
1:15.680–1:25.400
enTranscribe CPP负负责运行Whisper系列模型。格式是GGM和GGY。Transcribe RS运行的是ParaKit。
Transcribe CPP负负责运行Whisper系列模型。格式是GGM和GGY。Transcribe RS运行的是ParaKit。
1:26.100–1:31.620
jaCPAL负责跨平台音频输入。RDV负责全局键盘快捷键。
CPAL负责跨平台音频输入。RDV负责全局键盘快捷键。
1:32.500–1:38.000
ja它还用到一个叫Roboto的Core。提供实时音频流和重采样。
它还用到一个叫Roboto的Core。提供实时音频流和重采样。
1:38.000–1:40.808
ja这个组合让它用起来特别简单,
这个组合让它用起来特别简单,
1:40.808–1:42.011
ja也特别清亮。
也特别清亮。
1:42.011–1:45.420
ja连在我的MacBook上都很轻松。
连在我的MacBook上都很轻松。
1:47.100–1:49.580
ja从用户角度看,整个流程也很简单。
从用户角度看,整个流程也很简单。
1:50.340–1:53.460
ja你先设一个自定义快捷键,然后可以切缓开关。
你先设一个自定义快捷键,然后可以切缓开关。
1:54.340–1:56.360
ja或者长按来实现Push to Talk。
或者长按来实现Push to Talk。
1:57.360–2:00.320
ja按住的时候,Colero VAD会在后台悄悄过滤掉静音。
按住的时候,Colero VAD会在后台悄悄过滤掉静音。
2:00.320–2:03.720
ja这样就不会白白消耗算力去转写整段空白。
这样就不会白白消耗算力去转写整段空白。
2:04.560–2:08.160
ja松开后,Handy会把音频发给你选定的模型。
松开后,Handy会把音频发给你选定的模型。
2:09.200–2:13.640
ja再把转写结果直接粘贴到当时当前聚焦的输入框里。
再把转写结果直接粘贴到当时当前聚焦的输入框里。
2:14.660–2:16.460
jaHandy并不是这方面独有的。
Handy并不是这方面独有的。
2:17.400–2:21.460
ja市面上还有不少语音转写应用也差不多是这种工作方式。
市面上还有不少语音转写应用也差不多是这种工作方式。
2:22.160–2:25.680
ja不过我最喜欢的是你可以自己选喜欢的模型。
不过我最喜欢的是你可以自己选喜欢的模型。
2:26.340–2:29.900
ja模型列表里的每个模型都有速度和准确率的指标。
模型列表里的每个模型都有速度和准确率的指标。
2:30.320–2:33.440
ja这有点像在Mario Kart里选自己最喜欢的角色。
这有点像在Mario Kart里选自己最喜欢的角色。
2:34.160–2:36.440
ja你可以决定哪项指标对你来说最重要。
你可以决定哪项指标对你来说最重要。
2:36.940–2:42.180
ja对我来说,我发现用ParaKit Unify 0,6BP模型就很好用。
对我来说,我发现用ParaKit Unify 0,6BP模型就很好用。
2:42.840–2:46.980
ja因为ParaKit是一个CPU1模型,而且按他们自己的数据。
因为ParaKit是一个CPU1模型,而且按他们自己的数据。
2:47.700–2:50.640
ja它在终端爱武芯片上的运行速度大约是5倍10时。
它在终端爱武芯片上的运行速度大约是5倍10时。
2:51.200–2:53.300
ja我的MR Max远远超过这个Page。
我的MR Max远远超过这个Page。
2:53.960–2:56.820
ja所以我把它放在后台跑的时候甚至都感觉不到。
所以我把它放在后台跑的时候甚至都感觉不到。
2:57.620–2:59.580
ja而且可选项真的很多。
而且可选项真的很多。
2:59.580–3:02.920
ja它们甚至还有专门针对某一种的模型。
它们甚至还有专门针对某一种的模型。
3:03.880–3:07.200
ja比如我们有一些俄语版本,还有一些乌克兰语版本。
比如我们有一些俄语版本,还有一些乌克兰语版本。
3:08.000–3:10.240
ja我很喜欢嗨这句使命宣言里的坦诚。
我很喜欢嗨这句使命宣言里的坦诚。
3:11.020–3:13.440
jaHandy不是想成为最好的语音转文字应用,
Handy不是想成为最好的语音转文字应用,
3:14.120–3:16.280
ja而是想成为最容易二次开发的那个。
而是想成为最容易二次开发的那个。
3:17.060–3:20.063
ja而且你甚至可以把自己微调过的Whisper G
而且你甚至可以把自己微调过的Whisper G
3:20.063–3:23.340
jaGmail模型放进App的Models文件夹里。
Gmail模型放进App的Models文件夹里。
3:23.340–3:28.200
ja重启之后,它就会直接作为一个自定义选项出现。
重启之后,它就会直接作为一个自定义选项出现。
3:29.180–3:34.340
ja我觉得,如果任何时候要我在Handy和Whisper Flow之间选,
我觉得,如果任何时候要我在Handy和Whisper Flow之间选,
3:35.360–3:39.200
ja我会选Handy,最大的原因就是它可以离线运行。
我会选Handy,最大的原因就是它可以离线运行。
3:40.160–3:42.980
ja你不需要注册账号,也没有订阅费。
你不需要注册账号,也没有订阅费。
3:42.980–3:48.540
ja而且我很确定,所有我的语音输入音频样本都会留在我的机器上,
而且我很确定,所有我的语音输入音频样本都会留在我的机器上,
3:49.200–3:51.220
ja不会被偷偷拿去训练别的语音模型。
不会被偷偷拿去训练别的语音模型。
3:51.680–3:52.900
ja所以我真的很高兴。
所以我真的很高兴。
3:53.640–3:56.460
ja现在有了这样一个MIT许可的语音输入工具。
现在有了这样一个MIT许可的语音输入工具。
3:57.180–3:58.440
ja听起来都很棒,不过,
听起来都很棒,不过,
3:59.240–4:02.740
ja我们就来实际测试一下Pandy,看看它表现如何。
我们就来实际测试一下Pandy,看看它表现如何。
4:03.620–4:08.860
ja我会把Handy的表现和Whisper Flow以及Google自家的转写服务做个对比。
我会把Handy的表现和Whisper Flow以及Google自家的转写服务做个对比。
4:12.980–4:20.940
ja后者也可以在Google Docs里用。
后者也可以在Google Docs里用。
4:26.120–4:30.120
ja哦,昨天我去买了点菜,回家路上突然想起来。
哦,昨天我去买了点菜,回家路上突然想起来。
4:35.120–4:42.060
ja我得回头把我的SQLite数据库接到一个运行在我自定义GPU集群上的Cobot服务上。
我得回头把我的SQLite数据库接到一个运行在我自定义GPU集群上的Cobot服务上。
4:42.980–4:56.640
ja我能想到的一个办法是用一个叫Grog的LLM。
我能想到的一个办法是用一个叫Grog的LLM。
4:58.540–5:01.220
ja另外还从CheckGPT得到了一些帮助。
另外还从CheckGPT得到了一些帮助。
5:01.860–5:08.060
ja最后,我们做出了一个能运行的应用,但过程真的很折腾。
最后,我们做出了一个能运行的应用,但过程真的很折腾。
5:08.060–5:12.140
ja我们把这两部分分开来说。
我们把这两部分分开来说。
5:12.820–5:18.640
ja你看,这里的Google语音输入服务要差很多,它不会加标点。
你看,这里的Google语音输入服务要差很多,它不会加标点。
5:20.320–5:24.280
ja也不知道怎么分句,它把Cobot识别错了。
也不知道怎么分句,它把Cobot识别错了。
5:25.660–5:27.780
jaSQLite数据库也识别错了。
SQLite数据库也识别错了。
5:27.780–5:31.440
ja甚至连LLM这个词都没认出来。
甚至连LLM这个词都没认出来。
5:32.080–5:33.440
ja它以为Grog是Rock。
它以为Grog是Rock。
5:35.200–5:39.120
ja这个我最喜欢,它还把ChatGPT认成了ChatGPT。
这个我最喜欢,它还把ChatGPT认成了ChatGPT。
5:40.800–5:41.940
enChatGPT不错。
ChatGPT不错。
5:42.660–5:45.700
ja嗯,所以你能明显看出来Handy好多了。
嗯,所以你能明显看出来Handy好多了。
5:45.700–5:50.140
ja因为它有标点,还能识别一些特定术语。
因为它有标点,还能识别一些特定术语。
5:51.660–5:54.300
ja而且大多数技术术语都认对了。
而且大多数技术术语都认对了。
5:55.440–5:58.640
ja现在我们也来把这个结果和Whisper Flow比一下。
现在我们也来把这个结果和Whisper Flow比一下。
6:02.380–6:06.200
ja我要尽量把同样的文本重复的尽可能接近。
我要尽量把同样的文本重复的尽可能接近。
6:06.200–6:09.980
ja公平地测试一下。
公平地测试一下。
6:11.080–6:13.140
ja嗯,昨天我去买了些杂货。
嗯,昨天我去买了些杂货。
6:13.840–6:14.760
ja回来的路上。
回来的路上。
6:16.180–6:18.240
ja我突然想起我得回家。
我突然想起我得回家。
6:19.580–6:25.520
ja把我的SQLite数据库接到一个运行在我自定义GPU集群上的Cobot服务上。
把我的SQLite数据库接到一个运行在我自定义GPU集群上的Cobot服务上。
6:30.380–6:33.820
ja我其实不知道该怎么做,所以只好找人帮忙。
我其实不知道该怎么做,所以只好找人帮忙。
6:33.820–6:37.100
ja我能想到的唯一能帮上忙的工具。
我能想到的唯一能帮上忙的工具。
6:37.780–6:39.440
ja是一个叫Grook的LLM。
是一个叫Grook的LLM。
6:40.340–6:43.620
ja后来,我也从ChatGPT那里得到了一点帮助。
后来,我也从ChatGPT那里得到了一点帮助。
6:44.660–6:48.620
ja最后,我们是把应用跑起来了,但过程真的很折腾。
最后,我们是把应用跑起来了,但过程真的很折腾。
6:49.660–6:53.420
ja好吧,你可以清楚地看到Whisper Flow做得最好。
好吧,你可以清楚地看到Whisper Flow做得最好。
6:54.420–6:58.120
ja它把句子分得很准确,而且所有术语都没出错。
它把句子分得很准确,而且所有术语都没出错。
6:59.180–7:03.420
ja毕竟这是商业产品,你会以为它会比开源工具更好。
毕竟这是商业产品,你会以为它会比开源工具更好。
7:03.820–7:09.400
ja但说实话,这个结果和Whisper Flow之间并没有那么大差别。
但说实话,这个结果和Whisper Flow之间并没有那么大差别。
7:10.340–7:14.520
ja所以,我还是更喜欢用Handy,因为它免费、私密。
所以,我还是更喜欢用Handy,因为它免费、私密。
7:15.480–7:16.440
ja而且是开源的。
而且是开源的。
7:16.440–7:19.940
ja不过,Whisper Flow在这里确实做得很不错。
不过,Whisper Flow在这里确实做得很不错。
7:20.980–7:24.320
ja所以总的来说,它还是一个很靠谱的服务。
所以总的来说,它还是一个很靠谱的服务。
7:25.460–7:27.500
ja好了,各位,概括来说就是这样。
好了,各位,概括来说就是这样。
7:27.960–7:29.240
ja这个功能确实很实用。
这个功能确实很实用。
7:29.940–7:31.240
ja我刚才真不是开玩笑。
我刚才真不是开玩笑。
7:32.020–7:34.680
ja说它已经成了我最喜欢的语音听写工具。
说它已经成了我最喜欢的语音听写工具。
7:34.680–7:37.840
ja我甚至有点担心,要是我用得太频繁。
我甚至有点担心,要是我用得太频繁。
7:38.600–7:40.960
ja自己可能都会忘了怎么用键盘打字。
自己可能都会忘了怎么用键盘打字。
7:41.700–7:43.720
ja不过,这只是我的个人看法和观察。
不过,这只是我的个人看法和观察。
7:44.500–7:45.900
ja那你觉得Handy怎么样?
那你觉得Handy怎么样?
7:46.460–7:47.300
ja你是过了吗?
你是过了吗?
7:47.800–7:48.500
ja你会用吗?
你会用吗?
7:49.360–7:51.200
ja欢迎在下方评论区告诉我们。
欢迎在下方评论区告诉我们。
7:51.760–7:54.880
ja各位,如果你喜欢这类技术解析,
各位,如果你喜欢这类技术解析,
7:55.200–7:57.200
ja也请在视频下方点个赞。
也请在视频下方点个赞。
7:57.200–8:00.940
ja让我知道,别忘了订阅我们的频道。
让我知道,别忘了订阅我们的频道。
8:01.820–8:03.460
en我是BetterStack的Andreas,
我是BetterStack的Andreas,
8:03.780–8:05.020
ja我们下期视频再见。
我们下期视频再见。
8:06.120–8:06.560
ja音乐
音乐