📱 NanoAvatar

改变了数字人应用的使用频率和规模上限

📱 23年手机芯片 · 41 FPS · ⚡ 首帧延迟 103 ms

📱 下载 Android App(完整版 / Lite) · 💻 源码与使用说明

🎬 效果演示 · 📊 性能实测 · English · 简体中文

**直接在手机上生成高保真数字人视频,无需云端 GPU。** ## 🎬 实际效果 > **泛化能力展示:** 以下演示案例未用于模型训练,模型也未针对这些案例进行专门微调。
中文演示 英文演示
**断网体验端侧数字人生成模型。** App 内置模型和人物,录音即可驱动数字人。[安卓使用说明](https://github.com/wpydcr/NanoAvatar/blob/main/README.zh-CN.md#run-on-android)。 ## 📊 性能实测 | 模型 | 设备 | 模型 FPS | 首帧 | 内存 / 显存估算 | | --- | --- | ---: | ---: | ---: | | 📱 NanoAvatar 完整版 | **23年 · 骁龙 8 Gen 3**
Android 14 | **39 FPS** | **115 ms** | **834 MiB** | | 📱 NanoAvatar Lite | **23年 · 骁龙 8 Gen 3**
Android 14 | **41 FPS** | **103 ms** | **700 MiB** | | 📱 NanoAvatar Lite | **21年 · 骁龙 8 Gen 1**
Android 15 | **18 FPS** | **183 ms** | **693 MiB** | | ⚡ 量化版 | **RTX 4090**
Windows CUDA | **333 FPS** | **18 ms** | **834 MiB** | | 🖥️ 满血版 | **RTX 4090**
Windows CUDA | **224 FPS** | **37 ms** | **1119 MiB** | 安卓首帧统计从音频特征提取到首张图像生成的耗时。 模型生成 **256 × 256 的人脸区域**,最终画面按原视频分辨率合成。 🌊 **流式生成,边收音频边开口。** 接入流式大模型和流式 TTS,实测约 **0.3 秒开始说话**,无需等待整段音频生成完成。 ## 📦 选择并下载模型 | 模型 | 文件 | 内容 | | --- | --- | --- | | ⚡ 量化版 | [`quantized/`](https://huggingface.co/wpydcr/NanoAvatar/tree/main/quantized) | PyTorch/CUDA:HuBERT W8A16、口播模型混合 INT8 和 CUDA DLL | | 🖥️ 满血版 | `full-precision/`(come soon) | PyTorch:HuBERT FP16、口播模型 FP32 | | 📱 安卓编译版 | [`android-qnn/`](https://huggingface.co/wpydcr/NanoAvatar/tree/main/android-qnn) | CPU:人脸/音频编码器原始 FP32;QNN:HuBERT W8A16、生成器 HTP FP16 | 量化 CUDA 运行时面向 **Windows CUDA SM89(RTX 4090)**。安卓模型包面向 **骁龙 8 Gen 3 / HTP v75**。 安装 Hugging Face CLI,然后选择需要的模型下载: ```shell python -m pip install huggingface_hub ``` ### ⚡ 量化版 ```shell hf download wpydcr/NanoAvatar --include "quantized/*" --local-dir models ``` ### 🖥️ 满血版 ```shell hf download wpydcr/NanoAvatar --include "full-precision/*" --local-dir models ``` ### 📱 安卓编译版 ```shell hf download wpydcr/NanoAvatar --include "android-qnn/*" --local-dir models ``` 下载时保留完整目录结构。 运行与接入说明:[GitHub 上的 NanoAvatar](https://github.com/wpydcr/NanoAvatar/blob/main/README.zh-CN.md)。 ## 许可 [chinese-hubert-large](https://huggingface.co/TencentGameMate/chinese-hubert-large) 及其量化、编译版本继承上游 MIT 许可。 我们自己的口播模型及其量化、编译版本采用 [CC BY-NC 4.0](https://creativecommons.org/licenses/by-nc/4.0/),可在遵守署名等许可条件的前提下用于学术研究及其他非商业用途。 **商业授权:**[wupingyu@mail.ustc.edu.cn](mailto:wupingyu@mail.ustc.edu.cn)。 完整许可条款见 [LICENSE](LICENSE)。