继 MiniMind 和 MiniMind-V 之后,MiniMind-O 是该系列的第三步,旨在实现一个同时具备听、看、说的多模态交互能力的模型,接收文本、语音和视觉信号,输出文本和流式语音。现有 Omni 模型大多基于庞大的预训练权重,而 MiniMind-O 从 0 训练,提供一个轻量级、完整的起点,解决了训练和调整 Omni 模型领域的空白。核心技术采用从 0 使用 PyTorch 原生实现,无需依赖第三方框架的高层抽象。目标是让开发者能够轻松上手,从第一行代码开始训练一个能听、能看、能思考、能说的模型。
MiniMind-O 是当前公开模型中规模最小的完整 Omni 实现之一,参数量仅为 0.1B。它采用 Thinker–Talker 双路径架构,将语音和文本的处理融合到同一模型中,避免了传统 ASR-LLM-TTS 流水线带来的延迟和信息损失。项目提供了从 0 训练的完整代码、模型权重、训练数据和技术报告,支持多模态输入输出,以及多种音色克隆和 WebUI 等便捷功能。核心算法均使用 PyTorch 原生实现,易于理解和定制。
- Complete Code & Model Weights: Offers complete codebase and pre-trained weights for easy experimentation and customization.
- Multi-Modal Input/Output: Supports text, audio, and vision as input, and text and streaming audio as output.
- Lightweight Architecture: Achieves Omni capabilities with a small model size (~0.1B parameters), suitable for personal GPUs.
- Flexible Training: Provides mini and full datasets for efficient training and evaluation, with support for various training configurations.
- Voice Cloning & WebUI: Includes built-in voice cloning capabilities and a user-friendly WebUI for interactive experimentation.
MiniMind-O 是一个积极开发的项目,提供了完整的代码和可用于快速实验的预训练模型。项目积极更新并持续改进,文档和社区支持也在不断完善中。代码清晰,注释详细,模型训练流程和推理工具都易于使用。该项目的开发团队持续发布新的版本和更新,并积极维护社区。
MiniMind-O 旨在帮助研究人员和开发者轻松构建和实验强大的全模态 Omni 模型。它为资源有限的用户提供了一个轻量级且功能完善的起点,降低了 Omni 模型开发的门槛。 该项目适用于对 Omni 模型研究、语音合成、多模态交互等领域感兴趣的开发者和研究人员,可以快速搭建实验环境并构建定制化的 Omni 应用。