老规矩先说产品体验下来的总体感受:语音识别延迟低、模型数据全本地的隐私性强、产品设计体验待优化。
语音识别延迟低
和同类的笔记产品、线上会议产品的语音识别模块相比,延迟相对更低,但不算非常明显,可能我的核心使用场景是会议的记录,对延迟的要求不高,所以感受不明显。
模型数据全本地的隐私性强
本地化的模型隐私性确实得到了保证,这一点就可以让这个产品在我的日常应用里占据一席之地,支持自定义词典进行AI纠正的功能很有价值,但是对于本地化的应用来说,这个功能对我来说有点鸡肋,如果是联网的应用我会有更多的产品选择。
产品设计体验待优化
1、流式输出的问题,现在用户基本已经都习惯了在语音识别的过程中实时查看识别结果的模式,没有流式输出会让用户对产品充满不安全感,同时如果词典未配置或者环境声音比较嘈杂,用户最后直接看到一个磕磕绊绊很多错字和标点符号的识别内容,会立刻下头,很大程度上影响了用户的产品体验,尤其是初次使用产品的用户。
2、既然AI纠正的配置已经可以引入远程大模型,那么完全可以根据远程大模型对录音文本内做一些二次加工或者简单问答,不然文本识别的内容依然要导出粘贴,如果可以一站完成简单处理,可以很大提升用户体验。
总结一下,我的体验主要是从一个会议录音转写的需求出发,这个产品的亮点主要在本地部署的隐私性上,但是如果是单纯喜欢语音输入这个方式的用户,可能使用产品的体验会更好,产品的低延迟和本地化的优势会更明显,同时使用频率越高,本地部署的免费优势也越大,能节省很多成本。最后能看到产品的开发者在用心的收集和响应用户反馈,很多用户的提出的建议也在被采纳,期望这样的产品可以越来越好。