Any-to-Any
Transformers
ONNX
Safetensors
English
Chinese
multimodal
audio
video
speech
streaming
full-duplex
long-video
custom-code
Instructions to use inclusionAI/Realtime-Venus with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use inclusionAI/Realtime-Venus with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("inclusionAI/Realtime-Venus", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Polish Chinese model documentation
Browse files- README_zh.md +11 -11
README_zh.md
CHANGED
|
@@ -26,20 +26,20 @@
|
|
| 26 |
|
| 27 |
## 1. 🧭 概览
|
| 28 |
|
| 29 |
-
本仓库提供 [Realtime-Venus](https://realtime-venus.github.io/) 系统的两
|
| 30 |
|
| 31 |
-
- **Realtime-Venus-Omni**(`Realtime-Venus-Omni/`):9B 音视频交互模型
|
| 32 |
-
- **Realtime-Venus-Audio**(`Realtime-Venus-Audio/`):专注于音频
|
| 33 |
|
| 34 |
-
两个目录均包含
|
| 35 |
|
| 36 |
## 2. ✨ 核心亮点
|
| 37 |
|
| 38 |
-
- **原生全双工对话:** 在说话时持续感知输入,能够区分简短附和、打断、纠正和话题
|
| 39 |
-
- **Omni-Proactive 主动交互:** 持续
|
| 40 |
-
- **异步任务委派:**
|
| 41 |
-
- **无需额外训练的长视频记忆:**
|
| 42 |
-
- **文本与语音输出:**
|
| 43 |
|
| 44 |
## 3. 📋 模型信息
|
| 45 |
|
|
@@ -49,7 +49,7 @@
|
|
| 49 |
| 基础架构 | MiniCPM-o 4.5 / Omni-Flow | MiniCPM-o 4.5 / Omni-Flow |
|
| 50 |
| 视觉编码器 | SigLIP2 | 推理时不使用 |
|
| 51 |
| 音频编码器 | Whisper-Medium | Whisper-Medium |
|
| 52 |
-
| 语言模型
|
| 53 |
| 语音生成 | 离散 S3 语音 token,配合流式流匹配解码器 | 使用相同解码器,在全双工模式下启用 |
|
| 54 |
| 输入 | 视频/图像、音频和文本 | 音频和文本 |
|
| 55 |
| 输出 | 文本,以及可选的语音波形 | 文本和语音波形 |
|
|
@@ -89,7 +89,7 @@
|
|
| 89 |
|
| 90 |
## 6. 🛠️ 安装
|
| 91 |
|
| 92 |
-
需要 Python 3.10、CUDA 和 FFmpeg。先下载仓库
|
| 93 |
|
| 94 |
```bash
|
| 95 |
huggingface-cli download inclusionAI/Realtime-Venus --local-dir .
|
|
|
|
| 26 |
|
| 27 |
## 1. 🧭 概览
|
| 28 |
|
| 29 |
+
本仓库提供 [Realtime-Venus](https://realtime-venus.github.io/) 系统的两款模型:
|
| 30 |
|
| 31 |
+
- **Realtime-Venus-Omni**(`Realtime-Venus-Omni/`):9B 音视频交互模型,能够持续理解画面与声音,自主判断是否需要回应、何时回应,并在统一的因果时间线上生成文本和语音。模型基于 MiniCPM-o 4.5 构建,支持主动交互、语义级打断处理,以及无需额外训练的长视频记忆(Memory)。
|
| 32 |
+
- **Realtime-Venus-Audio**(`Realtime-Venus-Audio/`):专注于音频理解和语音对话,采用与 Omni 相同的流式主干网络,可输出文本或语音。
|
| 33 |
|
| 34 |
+
两个模型目录均包含权重和自定义的 Hugging Face Transformers 代码。负责异步任务执行的 Realtime-Venus-Harness 及其外部工具集成见 [GitHub 仓库](https://github.com/inclusionAI/Realtime-Venus)。
|
| 35 |
|
| 36 |
## 2. ✨ 核心亮点
|
| 37 |
|
| 38 |
+
- **原生全双工对话:** 模型在说话时仍持续感知输入,能够区分用户的简短附和、打断、纠正和话题切换。
|
| 39 |
+
- **Omni-Proactive 主动交互:** 持续理解时间对齐的音视频内容,在需要回应的事件发生时主动发言,无需等待用户提示。
|
| 40 |
+
- **异步任务委派:** 通过流内 `<delegate>` 请求发起任务,并在同一条因果时间线上接收后端异步返回的结果。外部任务与对话并行运行,不会阻塞当前交流。执行这些请求需要 Realtime-Venus-Harness 运行时,详见 [GitHub 仓库](https://github.com/inclusionAI/Realtime-Venus)。
|
| 41 |
+
- **无需额外训练的长视频记忆:** 记录视觉信息丰富的时刻,根据问题检索相关且不重复的证据,再重组对应的音视频上下文。
|
| 42 |
+
- **文本与语音输出:** 使用仓库提供的 Token2wav 资源和参考音色,在生成回复文本的同时输出原生语音。
|
| 43 |
|
| 44 |
## 3. 📋 模型信息
|
| 45 |
|
|
|
|
| 49 |
| 基础架构 | MiniCPM-o 4.5 / Omni-Flow | MiniCPM-o 4.5 / Omni-Flow |
|
| 50 |
| 视觉编码器 | SigLIP2 | 推理时不使用 |
|
| 51 |
| 音频编码器 | Whisper-Medium | Whisper-Medium |
|
| 52 |
+
| 语言模型主干 | Qwen3-8B | Qwen3-8B |
|
| 53 |
| 语音生成 | 离散 S3 语音 token,配合流式流匹配解码器 | 使用相同解码器,在全双工模式下启用 |
|
| 54 |
| 输入 | 视频/图像、音频和文本 | 音频和文本 |
|
| 55 |
| 输出 | 文本,以及可选的语音波形 | 文本和语音波形 |
|
|
|
|
| 89 |
|
| 90 |
## 6. 🛠️ 安装
|
| 91 |
|
| 92 |
+
运行示例需要 Python 3.10、CUDA 和 FFmpeg。先下载模型仓库,再安装 Python 依赖;两个模型的权重分别位于各自的子目录中:
|
| 93 |
|
| 94 |
```bash
|
| 95 |
huggingface-cli download inclusionAI/Realtime-Venus --local-dir .
|