VOICE-DRIVEN AI INTERFACE

语音 AI 交互界面

COGNITIVE SURFACE

将声音的频率、情绪、节奏
转化为可见的空间与色彩变化。

SCROLL
Project Concept

声音不是用来听的。
是用来看的。

这不是一个聊天界面。这是一个认知表面——AI 的思考过程被可视化为一个实时演化的 3D 声波球,你说话的每一秒都在改变它的形状。

基于 Hermes Agent 架构,接入白龙马语音引擎。后端是 DeepSeek 的 tool calling 推理,前端是 D3.js 驱动的粒子系统。中间层是声音——你的声音。

核心设计目标:让 AI 的思考过程变得可见、可感知、可信任。

语音AI交互界面主视图
Cognitive SurfaceD3.js + WebSocket
Visual Feedback Layers

声音的四层视觉翻译

01
Frequency Layer

频率可视化

声音的频率被映射为3D声波球的振幅。低频是缓慢的脉动,高频是急促的粒子飞溅。你说话的节奏,直接变成了空间的呼吸。

02
Emotion Mapping

情绪色彩映射

AI 分析语音的情感倾向——平静是深蓝,兴奋是橙红,犹豫是灰紫。整个界面的色调随情绪流动,不需要看文字就能感知对话的温度。

03
Rhythm Orchestration

节奏空间编排

语速快时粒子密集加速,停顿时空间静止呼吸。沉默不是空白,是视觉上的留白——整个界面在等你开口。

04
Memory Graph

记忆图谱渲染

对话中的关键概念被提取为节点,关联为连线。随着对话深入,图谱不断生长。你和 AI 聊过什么,一眼就能看到知识的形状。

Design Philosophy

设计意图:传统 AI 面板只告诉你"我在想"——一个 spinner,三个点。但你想知道的是:它在想什么?想到哪一步了?有没有卡住?

解决方案:把推理过程映射为空间变化。声波球的每一次脉动都是一个 token 在生成,粒子的密度反映注意力的集中度。

结果:你不再是在等 AI 回答——你在看着它思考。

System Flow
1
语音输入 → 频率分析
2
情绪识别 → 色彩映射
3
推理过程 → 粒子运动
4
记忆提取 → 图谱渲染
Tech Stack

技术实现

FastAPI + WebSocketD3.js 3D 粒子系统Edge TTS 语音合成DeepSeek Tool CallingLiquid Glass SVG 滤镜Hermes Agent 架构SSE 流式传输实时频率分析情绪色彩映射记忆图谱渲染