返回工具列表

Grok STT 1.0

这是一款可经 OpenRouter 调用的语音转文本模型,主要帮助开发者把多语言音频转成带词级时间戳和说话人区分的文字稿。

工具分类
开发者工具模型

工具简介

目前可以判断:Grok STT 1.0 是一款面向开发者集成的语音转文本模型,而不是完整的会议纪要应用、客服质检平台或剪辑工作台。证据主要来自 OpenRouter 与相关 X 帖,能确认它支持 25 种语言、词级时间戳、speaker diarization,并可通过 REST /v1/stt 接口调用;但这些更多是“已上线与受关注”的证明,不等于已被大量独立实测验证。

实际作用上,它更像 Whisper API、Deepgram 这类可嵌入产品的 STT 能力层,适合做字幕生成、访谈转写、播客整理、语音检索预处理和需要按词对齐的后处理。它不是通用聊天模型,也不是端到端的语音助手;更准确的类比是“可编程语音识别 API”。现有证据能支持功能点,但还不足以支持对识别准确率、噪声鲁棒性、不同口音表现做强结论。

门槛与成本方面,已知它通过 OpenRouter 提供 API。价格证据来自官方/平台社媒帖:$0.10 per audio hour,以及 OpenRouter 帖中出现的 token 计费展示;但目前缺少更完整官方定价页、限流、批处理、并发与长期稳定性说明,因此应把这些视为已公开的上线信息,不宜外推为稳定成本承诺。对采用者来说,主要门槛不是产品学习成本,而是需要自己处理上传、切片、重试、存储、隐私与质检流程。

适合谁:需要把音频转成结构化文本的开发者、小团队、做内容处理或知识库流水线的人。不太适合谁:想直接得到成熟 UI、强审校工作流或行业合规方案的非技术团队。社媒共识上,这一波更多是转发与上线通知,热度证明明显,讨论质量偏“公告型”;缺少长文评测、第三方教程、系统横评和持续实测,因此对“好不好用”的判断目前样本有限,仍应保守。

社媒关联内容

暂无关联内容

这个工具还没有可展示的社媒关联内容。

Grok STT 1.0 是什么?模型简介、社媒讨论与使用场景 | Tuleo