蛐蛐 (QuQu) 是 Wispr Flow 的开源免费替代方案,专为中文用户打造的注重隐私的桌面端语音输入与文本处理工具。与 Wispr Flow 不同,蛐蛐完全开源免费,数据本地处理,专为中文优化,支持国产AI模型。
蛐蛐 (QuQu)开源项目官网入口网址:https://github.com/yan5xu/ququ
蛐蛐(QuQu)是一款面向中文用户的开源免费语音输入与文本处理工具,定位为 Wispr Flow 的替代方案。项目全部代码托管在 GitHub(https://github.com/yan5xu/ququ ),遵循自由软件精神,任何人均可自由下载、审查、修改或二次分发。
核心特性
- 本地化隐私保护:所有语音和文本数据均在本地完成处理,不会上传至云端,最大限度避免敏感信息泄露。
- 国产模型深度集成:内置 FunASR 本地语音识别模型,实现高精度中文语音转文字;同时支持可配置的大语言模型(LLM),用户可自行选择本地部署的中文大模型或通过插件接入其他模型,实现智能生成、校对、摘要等高级文本处理。
- 跨平台桌面应用:基于 Node.js 18+ 与 pnpm 构建,兼容 macOS 10.15+、Windows 10+ 与 Linux,提供友好 UI,适合日常办公、写作、学习等场景。
- 完全免费开源:相较于商业版 Wispr Flow,蛐蛐免除订阅费用,代码公开透明,用户可自行审计安全性。
优势概览
- 免费且开源:消除商业授权费用,代码透明可审计。
- 数据本地化:所有处理在本机完成,保障用户隐私。
- 中文深度优化:专为中文语音与文本设计,兼容国产 AI 模型,提升识别与生成准确性。
- 高度可定制:用户可自行替换或扩展模型组件,灵活适配不同业务需求。
通过整合离线语音识别、可配置的大语言模型以及友好的桌面工作流,蛐蛐旨在为中文用户提供“一站式、可靠且安全”的生产力工具,打造下一代中文桌面语音工作流的标杆。
数据统计
相关导航
Multitalk 是一个由多个人物驱动的音频驱动多人物对话视频生成系统。它能够根据音频输入、参考图像和提示生成包含互动、对话、唱歌和卡通角色的视频内容。该系统支持单人或多人物生成、交互式虚拟人物控制、卡通角色生成、分辨率灵活性(480p 和 720p)以及长达 15 秒的视频生成。 MultiTalk官网入口网址:https://meigen-ai.github.io/multi-talk/MultiTalk开源项目地址:https://github.com/MeiGen-AI/MultiTalk Multitalk 的核心创新在于其音频驱动的多人物对话视频生成框架,能够根据多路音频输入、参考图像和提示生成符合音频内容的唇部动作和互动视频。该系统支持多种优化技术,如 INT8 量化、SageAttention、TeaCache 加速、多 GPU 推理、低 VRAM 推理等,以提升性能和效率。 Multitalk 的开发团队由多位研究人员组成,包括 Zhe Kong、Feng Gao、Yong Zhang 等,他们在人工智能、计算机视觉和多媒体生成领域具有深厚的专业背景。该项目已发布在 Hugging Face、GitHub 和 Replicate 平台,并提供了详细的模型下载、推理代码和使用示例。 Multitalk 的目标是推动多人物对话视频生成技术的发展,为虚拟人物、娱乐、教育和内容创作等领域提供强大的技术支持。其开源模型和工具的开放性,也为研究者和开发者提供了丰富的资源和灵活性。 Multitalk 的官方网站和项目页面提供了详细的文档、模型下载、使用指南和社区支持,是研究和应用该技术的重要资源。
AgenticSeek是一个100%本地运行的 Manus AI 替代品,支持语音的 AI 助手,可自主浏览网页、编写代码、规划任务,所有数据仅保存在你的设备上。专为本地推理模型设计,完全在你的硬件上运行,确保隐私无忧,无需云端依赖。 AgenticSeek官网入口网址1:https://fosowl.github.io/agenticSeek.htmlAgenticSeek官网入口网址2:http://agenticseek.tech/AgenticSeek官网开源项目地址:https://github.com/Fosowl/agenticSeekAgenticSeek中文介绍地址:链接 AgenticSeek 是一款革命性的本地 AI 助手,旨在为用户提供隐私保护和本地化运行的 AI 体验。它基于 DeepSeek R1 模型,支持多种功能,如网页浏览、代码生成、任务规划、语音交互等,所有数据处理均在本地完成,确保用户隐私和数据安全。 AgenticSeek 的核心理念是提供一个完全本地运行的 AI 助手,无需依赖云端服务,用户数据不会被发送到外部服务器。它支持多种功能,包括智能网页浏览、代码编写与调试、任务规划、多代理协作等,适用于开发、研究、办公、教育等多个领域。 为什么选择 AgenticSeek? 完全本地 & 私有 —— 所有内容都在你的电脑上运行,无云端、无数据共享。你的文件、对话和搜索都保持私密。智能网页浏览 —— AgenticSeek 可自主浏览互联网:搜索、阅读、提取信息、填写网页表单,全程免手动。自动化编程助手 —— 需要代码?它能编写、调试并运行 Python、C、Go、Java 等程序,无需监督。智能代理选择 —— 你提问,它自动判断最合适的代理来完成任务。就像有一支专家团队随时待命。规划并执行复杂任务 —— 从旅行规划到复杂项目,可将大任务拆分为步骤,调用多个 AI 代理协作完成。语音支持 —— 干净、快速、未来感的语音与语音转文本功能,让你像科幻电影中的 AI 一样与它对话。(开发中) AgenticSeek 的部署和使用相对简单,用户可以通过安装 Git、Python、Docker 等工具进行本地部署,并通过命令行或 Web 界面进行操作。它支持多种编程语言和任务处理能力,适合需要隐私保护和本地化 AI 解决方案的用户。 AgenticSeek 是一个开源项目,其代码托管在 GitHub 上,社区活跃,支持多语言和多平台部署,适合开发者和研究人员使用。 AgenticSeek 是一个功能强大、隐私保护、本地运行的 AI 助手,适合需要隐私保护和本地化 AI 解决方案的用户。
AutoResearchClaw 是一款革命性的开源框架,它实现了从单一研究想法到完整学术论文的端到端全自动研究闭环。该项目深度集成于OpenClaw生态系统,旨在彻底消除科研过程中的人工重复劳动,让研究人员能够更专注于核心思想的碰撞,而非琐碎的格式调整与实验执行。 AutoResearchClaw开源项目官网入口网址:https://github.com/aiming-lab/AutoResearchClaw 核心能力:一句指令,交付论文 该项目的最大魅力在于其极简的交互方式。用户只需向系统输入一个核心研究指令或课题,剩下的复杂工作流程将完全自动化。具体而言,系统能够根据用户提供的想法,自动完成从文献搜集、实验设计、代码编写与执行,到最终生成符合顶级会议(如NeurIPS、ICLR)LaTeX模板的论文初稿的全过程。运行结束后,它会交付一个包含所有实验数据、代码和文档的完整成果包。 技术架构:多智能体协作与自我进化 AutoResearchClaw的强大能力源于其精密的工程化设计。它将AI研究员的工作流拆解为8大阶段、23个子阶段,并通过多智能体协作与工具调用的方式实现每个环节的自动化。其技术核心包括: JINA驱动的语义检索与文献验证:系统利用RAG架构,从Arxiv等学术数据库进行多维语义检索,并通过学术引用图谱自动验证文献真实性,有效防御AI幻觉生成的虚假引用,确保学术严谨性。多智能体辩论与决策机制:在关键阶段(如假设生成、结果分析),系统会启动多个具备不同视角的虚拟智能体进行结构化辩论。例如,一个智能体负责疯狂输出创意,另一个则排查本地GPU算力,还有一个专门挑刺找漏洞。通过这种模拟同行评审的博弈,强制提升研究质量。自我修复与进化的流水线:系统具备“PIVOT/REFINE”决策循环。实验阶段会根据结果自动评估假设,决定是继续推进、优化参数还是彻底推翻重来。更重要的是,它能从每次运行中提取细粒度教训并持久化存储,通过时间衰减加权的方式注入未来的研究任务中,使流水线具备从错误中学习的能力。全面的质量监控(Sentinel看门狗):后台监控模块会捕获主流水线可能遗漏的问题,如检测实验指标中的异常值、确保论文声称的实验次数与实际代码运行次数一致、评估引用的相关性等,从多个维度守卫研究质量。部署与使用 AutoResearchClaw设计为OpenClaw兼容服务。对于OpenClaw用户,只需将项目地址分享给OpenClaw,它便能自动理解并部署整个流水线,用户通过一句“帮我研究[你的主题]”即可启动。同时,它也支持通过命令行(CLI)独立使用。 AutoResearchClaw不仅仅是一个工具,更是一个“物理意义上零人工干预”的自动化研究基础设施。它通过硬核的工程化设计,将前沿的AI能力转化为稳定、可复现的学术生产力,代表了AI驱动科研的未来方向,有望为研究人员节省成百上千小时的人工成本。
Xinference 是一个开源的 AI 模型部署与推理框架,旨在简化大模型的部署、运行与调用流程。它支持多种模型类型,包括大语言模型(LLM)、多模态模型、语音识别模型等,并提供高性能、分布式、跨平台的推理能力。Xinference 提供了多种部署方式,包括本地部署、容器化部署、Docker 部署等,支持多种硬件环境,如 CPU、GPU、Apple M 系列芯片等。 Xinference官网入口网址:https://inference.readthedocs.io/Xinference中文官网网址:https://inference.readthedocs.io/zh-cn/Xinference开源项目地址:https://github.com/xorbitsai/inference Xinference 的核心优势包括多模型支持、灵活量化配置、跨硬件适配、分布式推理、统一 API 接口和自动模型管理。它支持多种推理引擎,如 vLLM、TensorRT、Transformers、vLLM、llama.cpp 等,能够优化推理性能并提升模型推理效率。Xinference 还支持与 LangChain、LlamaIndex、LangChain 等框架的无缝集成,便于构建复杂的 AI 应用。 Xinference 提供了多种部署方式,包括命令行工具、RESTful API、CLI、WebUI 等,用户可以通过命令行或 API 调用模型,支持异步调用和流式处理。Xinference 的安装和使用相对简便,支持通过 pip 安装,也支持通过 Docker Compose 快速部署。 Xinference 是一个开源项目,托管在 GitHub 上,用户可以通过 GitHub、Slack 社区、Twitter 等平台参与项目,提交问题、报告 Bug 或提出功能请求。Xinference 的社区活跃,支持用户交流和贡献代码,持续更新和优化项目。 Xinference 是一个功能强大、灵活且易于使用的 AI 模型部署与推理框架,适用于企业级和研究级的 AI 应用开发。
AniPortrait 是由腾讯游戏智迹团队研发的一款开源 AI 工具,旨在通过音频和参考肖像图像生成高质量的动态视频动画。该项目的核心功能是将静态肖像转化为生动的动画形象,同时支持音频驱动的面部表情和头部姿势控制,使生成的动画与输入音频同步,呈现出逼真的视觉效果。 AniPortrait项目官网入口网址:https://github.com/Zejun-Yang/AniPortraitAniPortrait在线演示网址:https://huggingface.co/spaces/ZJYang/AniPortrait_official AniPortrait 的工作流程分为两个主要阶段:首先是 Audio2Lmk(音频到 2D 面部标记点),该模块从音频中提取关键信息,包括面部表情和头部姿态的 3D 网格和头部姿态信息;其次是 Lmk2Video(2D 面部标记点到视频),该模块利用提取的面部特征生成高质量的动态视频。此外,AniPortrait 还支持人脸重绘功能,允许用户将照片中的人物替换到源视频中,从而实现更加灵活的动画创作。 AniPortrait 的技术特点包括: 音频驱动的动画合成:通过分析音频中的语音节奏和音调,自动调整人物的面部表情和口型,使其能够说话或唱歌。高质量的视觉效果:利用扩散模型和运动模块,生成高分辨率、时间一致性的逼真动画。灵活的模型配置:用户可以根据需求调整模型权重和配置参数,以实现个性化的动画效果。广泛的应用场景:适用于游戏开发、虚拟主播、社交媒体内容创作、艺术创作等多个领域。 AniPortrait 的开源特性使其具有较高的灵活性和扩展性。用户可以通过 GitHub 获取代码并进行定制开发,同时社区提供了详细的文档和支持,帮助新手快速上手。此外,AniPortrait 还支持多种语言,并且能够适应不同的硬件配置,进一步提升了其普适性和实用性。 AniPortrait 是一个功能强大且灵活的 AI 动画生成工具,能够满足用户在动态视频制作中的多样化需求。无论是专业人士还是普通用户,都可以通过 AniPortrait 创作出独一无二的艺术作品或实用内容。
GPT-SoVITS 是一个基于文本到语音(TTS)和语音转换(VC)技术的开源项目,旨在实现高质量的语音合成与转换。该项目支持多种语言,包括英语、日语、韩语、粤语和中文,并且具备零样本(Zero-shot)和少量样本(Few-shot)训练能力,能够快速适应不同说话人和语言环境。 GPT-SoVITS开源项目官网地址:https://github.com/RVC-Boss/GPT-SoVITSGPT-SoVITS中文介绍:链接GPT-SoVITS指南:https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1eGPT-SoVITS视频介绍:链接 GPT-SoVITS 提供了丰富的功能,包括即时文本到语音转换、语音分离与增强、自动训练集分割、ASR(自动语音识别)和文本标注工具,帮助用户轻松创建训练数据集和模型。用户可以通过 WebUI 界面进行模型训练、推理和模型优化,支持多种设备和平台,包括 Windows、Linux 和 Docker 容器部署。 在性能方面,GPT-SoVITS 在推理速度上表现出色,尤其在高性能 GPU 上运行速度更快,适合大规模应用。此外,项目还提供了详细的安装指南、模型下载链接和社区支持,方便用户快速上手和使用。 GPT-SoVITS 是一个功能强大、灵活且易于使用的语音合成与转换工具,适合研究人员、开发者和语音技术爱好者使用。
