蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统
inclusionAI/Realtime-Venus
精选理由
蚂蚁和清华开源了全双工对话加异步委托任务的系统,含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时,可直接下载推理或跑浏览器 demo。
AI 摘要
蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。
正文 · AI 翻译
一个具备异步委派能力的全双工交互系统
Venus 团队 · 蚂蚁集团 · 清华大学
概览 · 快速开始 · 结果 · 代码结构 · 引用
概览
实时看、听、回应——同时让后台任务与对话并行运行。Realtime-Venus 将全双工对话模型与异步执行框架相结合。你可以让助手处理某项任务,并在其运行期间继续对话。结果会返回到同一段对话中,以语音形式播报。
该项目汇集了三个组件:
组件 作用
Realtime-Venus-Omni · 9B 一个面向流式音频与视频、主动交互以及原生语音生成的对话模型。
Realtime-Venus-Audio · 9B 一个单独训练的模型,用于语音交互、音频理解和原生语音生成。
Realtime-Venus-Harness 一个共享运行时,负责捕获委派的请求、执行后台工作,并将结果返回给发起该请求的对话。
Realtime-Venus 能实现什么
持续的视听交互。 Omni 观察流式摄像头和麦克风输入,并能在不断变化的场景需要时主动发起响应。
全双工对话。 模型在说话的同时处理传入的语音,学习区分确认应答和背景语音与需要修改回复的打断。
异步委派。 模型可以将自然语言任务交给 Harness 进行推理或工具执行,同时实时交互继续进行。
结果回到同一对话中。 Harness 准备回复;对话模型负责其时机和原生语音输出。工作追踪将任务完成与语音交付分离。
该论文介绍了该模型系列、双循环运行时、训练数据和评估。本次源码发布包含 Omni 模型集成、可复用的 Harness 包,以及一个使用 Codex 任务后端的浏览器演示。该演示的纯麦克风模式同样使用 Omni。
快速开始
1. 安装依赖
在仓库根目录下运行这些命令。如需独立推理,请使用带 CUDA 和 FFmpeg 的 Python 3.10,并安装你所使用模型的依赖:
# Realtime-Venus-Omni python -m pip install -r /path/to/Realtime-Venus-Omni/requirements.txt
# Realtime-Venus-Audio python -m pip install -r requirements.txt
如需运行浏览器演示,请在 Linux 上运行安装脚本。它会创建一个隔离的 Python 3.11/3.12 环境,并安装模型、Web 服务和 Harness 依赖:
bash install.sh
然后选择独立推理或下方的在线体验。
2. 离线推理 · 前端使用
从上方链接下载模型 checkpoint,并将示例路径替换为你本地的目录。
Realtime-Venus-Omni
export REALTIME_VENUS_MODEL_PATH=/path/to/Realtime-Venus-Omni
python frontend/Realtime-Venus-Omni/offline_chat.py # With long-video Memory python frontend/Realtime-Venus-Omni/offline_memory_chat.py
这些示例从 checkpoint 的 assets/ 目录读取视频,并输出文本和语音。如需改为对录制输入进行全双工推理:
python frontend/Realtime-Venus-Omni/duplex_chat.py python frontend/Realtime-Venus-Omni/duplex_speech_in_chat.py python frontend/Realtime-Venus-Omni/duplex_memory_chat.py
双工示例会保存带字幕的视频。输入与输出路径参见Omni 指南。
Realtime-Venus-Audio
python frontend/Realtime-Venus-Audio/audio_offline_chat.py \ --model-path /path/to/Realtime-Venus-Audio \ --audio frontend/Realtime-Venus-Audio/case/case_offline.wav
离线推理返回文本。要对录制的音频运行全双工推理并保存为 24 kHz WAV:
python frontend/Realtime-Venus-Audio/audio_duplex_chat.py \ --model-path /path/to/Realtime-Venus-Audio \ --audio frontend/Realtime-Venus-Audio/case/case_duplex.wav \ --output output/duplex_response.wav
两个脚本都接受--system-prompt和--prompt;解码选项参见音频指南。
3. 在线双工体验
在线双工演示需要至少一块 NVIDIA A100 GPU。将完整的 Omni checkpoint 放入model_weight/,然后启动演示:
bash start.sh
对于位于其他位置的现有 checkpoint:
bash start.sh --model-path /path/to/Realtime-Venus-Omni
如有提示,请完成 Codex 登录。启动器会在8031上启动模型 API,并在8032上启动浏览器服务。
如果在远程服务器上运行,请在本地计算机上保持此隧道开启,并将user@server替换为你的 SSH 登录信息:
ssh -N -L 8032:127.0.0.1:8032 user@server
打开 http://localhost:8032,选择 语音、摄像头 + 麦克风 或 上传视频,然后开始对话。Checkpoint 布局、配置和服务管理详见 演示指南。
结果
图 1. 来自 论文 的视频与音频理解结果。
图 2. 来自 论文 的全双工交互结果。
代码结构图
Realtime-Venus/ ├── harness/ # Context, routing, agents, work state, and delivery │ ├── README.md │ └── requirements.txt # Harness media dependencies ├── frontend/ │ ├── Realtime-Venus-Omni/ # Audiovisual inference examples │ └── Realtime-Venus-Audio/ # Audio inference examples and input samples ├── demos/ │ ├── model/ # Checkpoint adapter and model HTTP API │ ├── server/ # Web sessions, media, settings, and artifacts │ ├── static/ # Browser UI, capture, playback, and logos │ ├── launcher/ # Configuration and process supervision │ ├── settings.py # Saved task and model preferences │ ├── install.py # Isolated environment installation │ └── requirements.txt # Model and application dependencies ├── assets/ # Paper figures, report, and Demo screenshot ├── pyproject.toml # Standalone Harness package ├── requirements.txt # Shared dependency entry for inference examples ├── config.example.json # Server configuration template └── install.sh / start.sh # Install, start, inspect, and stop the Demo
引用
@article{zhao2026realtime, title={{Realtime-Venus}: A full-duplex interaction system with asynchronous delegation}, author={{Venus Team,Ant Group;Tsinghua University}}, journal={arXiv preprint arXiv:2609.13814}, year={2026} }
许可证
本仓库中的源代码依据 Apache License 2.0 授权,带有单独许可声明的组件除外。第三方字体和论文插图保留各自的许可证;请参阅 demos/static/fonts/ 和 assets/README.md 中的许可证文件。
原文
Original Title
inclusionAI/Realtime-Venus
Source
蚂蚁 inclusionAI:GitHub 新仓库
Site
github.com
Author
inclusionAI
Published
2026-09-16 15:57