roysun2006 commited on
Commit
d9c6836
·
verified ·
1 Parent(s): 0ab6c8f

Polish Chinese model documentation

Browse files
Files changed (1) hide show
  1. README_zh.md +11 -11
README_zh.md CHANGED
@@ -26,20 +26,20 @@
26
 
27
  ## 1. 🧭 概览
28
 
29
- 本仓库提供 [Realtime-Venus](https://realtime-venus.github.io/) 系统的两个模型检查点:
30
 
31
- - **Realtime-Venus-Omni**(`Realtime-Venus-Omni/`):9B 音视频交互模型。它持续观看和聆听,判断是否响应以及何时响应,并在共享的因果时间线上生成文本和语音。该模型基于 MiniCPM-o 4.5 改造,支持主动交互、语义级打断处理,以及无需额外训练的长视频记忆(Memory)。
32
- - **Realtime-Venus-Audio**(`Realtime-Venus-Audio/`):专注于音频的模型检查点,采用相同的流式骨干网络,用于音频理解和音频驱动的对话,可输出文本或语音。
33
 
34
- 两个目录均包含模型权重与自定义 Hugging Face Transformers 代码。异步运行的 Realtime-Venus-Harness 及其外部工具集成位于 [GitHub 仓库](https://github.com/inclusionAI/Realtime-Venus)。
35
 
36
  ## 2. ✨ 核心亮点
37
 
38
- - **原生全双工对话:** 在说话时持续感知输入,能够区分简短附和、打断、纠正和话题转向。
39
- - **Omni-Proactive 主动交互:** 持续处理时间对齐的视频和音频,在事件需要响应时主动发言,无需等待用户提示。
40
- - **异步任务委派:** 在共享的因果时间线上发出流内 `<delegate>` 请求,并以相同方式接收后端异步返回的结果,使外部任务不会阻塞正在进行的对话。(执行这些请求需要 Realtime-Venus-Harness 运行时,详见 [GitHub 仓库](https://github.com/inclusionAI/Realtime-Venus)。)
41
- - **无需额外训练的长视频记忆:** 保存视觉信息丰富的时刻,检索与问题相关且不重复的证据,并重新组装对应的音视频上下文,无需额外训练。
42
- - **文本与语音输出:** 结合仓库内附带的 Token2wav 资源与参考音色,在生成回复文本的同时生成原生语音。
43
 
44
  ## 3. 📋 模型信息
45
 
@@ -49,7 +49,7 @@
49
  | 基础架构 | MiniCPM-o 4.5 / Omni-Flow | MiniCPM-o 4.5 / Omni-Flow |
50
  | 视觉编码器 | SigLIP2 | 推理时不使用 |
51
  | 音频编码器 | Whisper-Medium | Whisper-Medium |
52
- | 语言模型骨干 | Qwen3-8B | Qwen3-8B |
53
  | 语音生成 | 离散 S3 语音 token,配合流式流匹配解码器 | 使用相同解码器,在全双工模式下启用 |
54
  | 输入 | 视频/图像、音频和文本 | 音频和文本 |
55
  | 输出 | 文本,以及可选的语音波形 | 文本和语音波形 |
@@ -89,7 +89,7 @@
89
 
90
  ## 6. 🛠️ 安装
91
 
92
- 需要 Python 3.10、CUDA 和 FFmpeg。先下载仓库(两个模型检查点分别位于各自的子目录中),再安装 Python 依赖:
93
 
94
  ```bash
95
  huggingface-cli download inclusionAI/Realtime-Venus --local-dir .
 
26
 
27
  ## 1. 🧭 概览
28
 
29
+ 本仓库提供 [Realtime-Venus](https://realtime-venus.github.io/) 系统的两款模型:
30
 
31
+ - **Realtime-Venus-Omni**(`Realtime-Venus-Omni/`):9B 音视频交互模型,能够持续理解画面与声音,自主判断是否需要回应、何时回应,并在统一的因果时间线上生成文本和语音。模型基于 MiniCPM-o 4.5 构建,支持主动交互、语义级打断处理,以及无需额外训练的长视频记忆(Memory)。
32
+ - **Realtime-Venus-Audio**(`Realtime-Venus-Audio/`):专注于音频理解和语音对话,采用与 Omni 相同的流式主干网络,可输出文本或语音。
33
 
34
+ 两个模型目录均包含权重和自定义的 Hugging Face Transformers 代码。负责异步任务执行的 Realtime-Venus-Harness 及其外部工具集成见 [GitHub 仓库](https://github.com/inclusionAI/Realtime-Venus)。
35
 
36
  ## 2. ✨ 核心亮点
37
 
38
+ - **原生全双工对话:** 模型在说话时仍持续感知输入,能够区分用户的简短附和、打断、纠正和话题切换。
39
+ - **Omni-Proactive 主动交互:** 持续理解时间对齐的音视频内容,在需要回应的事件发生时主动发言,无需等待用户提示。
40
+ - **异步任务委派:** 通过流内 `<delegate>` 请求发起任务,并在同一条因果时间线上接收后端异步返回的结果。外部任务与对话并行运行,不会阻塞当前交流。执行这些请求需要 Realtime-Venus-Harness 运行时,详见 [GitHub 仓库](https://github.com/inclusionAI/Realtime-Venus)。
41
+ - **无需额外训练的长视频记忆:** 记录视觉信息丰富的时刻,根据问题检索相关且不重复的证据,再重组对应的音视频上下文。
42
+ - **文本与语音输出:** 使用仓库提供的 Token2wav 资源和参考音色,在生成回复文本的同时输出原生语音。
43
 
44
  ## 3. 📋 模型信息
45
 
 
49
  | 基础架构 | MiniCPM-o 4.5 / Omni-Flow | MiniCPM-o 4.5 / Omni-Flow |
50
  | 视觉编码器 | SigLIP2 | 推理时不使用 |
51
  | 音频编码器 | Whisper-Medium | Whisper-Medium |
52
+ | 语言模型主干 | Qwen3-8B | Qwen3-8B |
53
  | 语音生成 | 离散 S3 语音 token,配合流式流匹配解码器 | 使用相同解码器,在全双工模式下启用 |
54
  | 输入 | 视频/图像、音频和文本 | 音频和文本 |
55
  | 输出 | 文本,以及可选的语音波形 | 文本和语音波形 |
 
89
 
90
  ## 6. 🛠️ 安装
91
 
92
+ 运行示例需要 Python 3.10、CUDA 和 FFmpeg。先下载模型仓库,再安装 Python 依赖;两个模型的权重分别位于各自的子目录中:
93
 
94
  ```bash
95
  huggingface-cli download inclusionAI/Realtime-Venus --local-dir .