返回 AI 情报
产品精选 622026-09-16 15:57inclusionAI蚂蚁 inclusionAI:GitHub 新仓库

蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统

inclusionAI/Realtime-Venus

精选理由

蚂蚁和清华开源了全双工对话加异步委托任务的系统,含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时,可直接下载推理或跑浏览器 demo。

AI 摘要

蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。

正文 · AI 翻译

一个具备异步委派能力的全双工交互系统

Venus 团队 · 蚂蚁集团 · 清华大学

概览 · 快速开始 · 结果 · 代码结构 · 引用

概览

实时看、听、回应——同时让后台任务与对话并行运行。Realtime-Venus 将全双工对话模型与异步执行框架相结合。你可以让助手处理某项任务,并在其运行期间继续对话。结果会返回到同一段对话中,以语音形式播报。

该项目汇集了三个组件:

组件 作用

Realtime-Venus-Omni · 9B 一个面向流式音频与视频、主动交互以及原生语音生成的对话模型。

Realtime-Venus-Audio · 9B 一个单独训练的模型,用于语音交互、音频理解和原生语音生成。

Realtime-Venus-Harness 一个共享运行时,负责捕获委派的请求、执行后台工作,并将结果返回给发起该请求的对话。

Realtime-Venus 能实现什么

持续的视听交互。 Omni 观察流式摄像头和麦克风输入,并能在不断变化的场景需要时主动发起响应。

全双工对话。 模型在说话的同时处理传入的语音,学习区分确认应答和背景语音与需要修改回复的打断。

异步委派。 模型可以将自然语言任务交给 Harness 进行推理或工具执行,同时实时交互继续进行。

结果回到同一对话中。 Harness 准备回复;对话模型负责其时机和原生语音输出。工作追踪将任务完成与语音交付分离。

该论文介绍了该模型系列、双循环运行时、训练数据和评估。本次源码发布包含 Omni 模型集成、可复用的 Harness 包,以及一个使用 Codex 任务后端的浏览器演示。该演示的纯麦克风模式同样使用 Omni。

快速开始

1. 安装依赖

在仓库根目录下运行这些命令。如需独立推理,请使用带 CUDA 和 FFmpeg 的 Python 3.10,并安装你所使用模型的依赖:

# Realtime-Venus-Omni python -m pip install -r /path/to/Realtime-Venus-Omni/requirements.txt

# Realtime-Venus-Audio python -m pip install -r requirements.txt

如需运行浏览器演示,请在 Linux 上运行安装脚本。它会创建一个隔离的 Python 3.11/3.12 环境,并安装模型、Web 服务和 Harness 依赖:

bash install.sh

然后选择独立推理或下方的在线体验。

2. 离线推理 · 前端使用

从上方链接下载模型 checkpoint,并将示例路径替换为你本地的目录。

Realtime-Venus-Omni

export REALTIME_VENUS_MODEL_PATH=/path/to/Realtime-Venus-Omni

python frontend/Realtime-Venus-Omni/offline_chat.py # With long-video Memory python frontend/Realtime-Venus-Omni/offline_memory_chat.py

这些示例从 checkpoint 的 assets/ 目录读取视频,并输出文本和语音。如需改为对录制输入进行全双工推理:

python frontend/Realtime-Venus-Omni/duplex_chat.py python frontend/Realtime-Venus-Omni/duplex_speech_in_chat.py python frontend/Realtime-Venus-Omni/duplex_memory_chat.py

双工示例会保存带字幕的视频。输入与输出路径参见Omni 指南。

Realtime-Venus-Audio

python frontend/Realtime-Venus-Audio/audio_offline_chat.py \ --model-path /path/to/Realtime-Venus-Audio \ --audio frontend/Realtime-Venus-Audio/case/case_offline.wav

离线推理返回文本。要对录制的音频运行全双工推理并保存为 24 kHz WAV:

python frontend/Realtime-Venus-Audio/audio_duplex_chat.py \ --model-path /path/to/Realtime-Venus-Audio \ --audio frontend/Realtime-Venus-Audio/case/case_duplex.wav \ --output output/duplex_response.wav

两个脚本都接受--system-prompt和--prompt;解码选项参见音频指南。

3. 在线双工体验

在线双工演示需要至少一块 NVIDIA A100 GPU。将完整的 Omni checkpoint 放入model_weight/,然后启动演示:

bash start.sh

对于位于其他位置的现有 checkpoint:

bash start.sh --model-path /path/to/Realtime-Venus-Omni

如有提示,请完成 Codex 登录。启动器会在8031上启动模型 API,并在8032上启动浏览器服务。

如果在远程服务器上运行,请在本地计算机上保持此隧道开启,并将user@server替换为你的 SSH 登录信息:

ssh -N -L 8032:127.0.0.1:8032 user@server

打开 http://localhost:8032,选择 语音、摄像头 + 麦克风 或 上传视频,然后开始对话。Checkpoint 布局、配置和服务管理详见 演示指南。

结果

图 1. 来自 论文 的视频与音频理解结果。

图 2. 来自 论文 的全双工交互结果。

代码结构图

Realtime-Venus/ ├── harness/ # Context, routing, agents, work state, and delivery │ ├── README.md │ └── requirements.txt # Harness media dependencies ├── frontend/ │ ├── Realtime-Venus-Omni/ # Audiovisual inference examples │ └── Realtime-Venus-Audio/ # Audio inference examples and input samples ├── demos/ │ ├── model/ # Checkpoint adapter and model HTTP API │ ├── server/ # Web sessions, media, settings, and artifacts │ ├── static/ # Browser UI, capture, playback, and logos │ ├── launcher/ # Configuration and process supervision │ ├── settings.py # Saved task and model preferences │ ├── install.py # Isolated environment installation │ └── requirements.txt # Model and application dependencies ├── assets/ # Paper figures, report, and Demo screenshot ├── pyproject.toml # Standalone Harness package ├── requirements.txt # Shared dependency entry for inference examples ├── config.example.json # Server configuration template └── install.sh / start.sh # Install, start, inspect, and stop the Demo

引用

@article{zhao2026realtime, title={{Realtime-Venus}: A full-duplex interaction system with asynchronous delegation}, author={{Venus Team,Ant Group;Tsinghua University}}, journal={arXiv preprint arXiv:2609.13814}, year={2026} }

许可证

本仓库中的源代码依据 Apache License 2.0 授权,带有单独许可声明的组件除外。第三方字体和论文插图保留各自的许可证;请参阅 demos/static/fonts/ 和 assets/README.md 中的许可证文件。

原文

Original Title

inclusionAI/Realtime-Venus

Source

蚂蚁 inclusionAI:GitHub 新仓库

Site

github.com

Author

inclusionAI

Published

2026-09-16 15:57

阅读原文· github.com

继续阅读