Hacker News上出现了一个名为“Whodunnit AI”的创新项目,这是一个完全由语音驱动的谋杀解谜游戏。作者展示了他利用OpenAI最新的实时语音技术构建的互动体验,允许玩家通过麦克风直接“审讯”AI扮演的嫌疑人。该项目最初在两三年前启动,当时的语音AI技术尚处于早期阶段,但随着OpenAI gpt-realtime-2.1模型的发布,作者重新构建了系统以实现真正的对话式交互。在技术实现上,项目采用WebRTC协议进行语音流传输,确保了极低的延迟。为了应对实时API高昂的成本,作者引入了Clerk进行用户认证,并设置了30分钟的游戏时限,以防止在流量高峰期产生过高的账单。游戏的核心逻辑采用了多Agent架构:每个嫌疑人都配备了一套工具,当玩家发起指控时,系统会捕获指控对象和证据列表。随后,一个独立的“法官”模型(文中称为gpt-5-mini)会评估玩家是否陈述了案件所需的确凿证据。该机制允许意译,但拒绝模糊的怀疑。整个应用基于Next.js和MongoDB构建。作者邀请社区玩家测试这些嫌疑人是否能经受住严密的逻辑审问。
事件分析
💡 核心观点:低延迟语音交互正重塑AI智能体的沉浸感,但高昂的推理成本仍是实时应用大规模普及的核心阻碍。
原文链接:Hacker News

评论前必须登录!
立即登录 注册