项目框架

OpenRouter
OpenRouter

OpenRouter 是一个专注于大型语言模型(LLMs)和其他 AI 模型的统一接口访问平台,旨在为开发者和用户提供一个简单、高效且灵活的工具。OpenRouter 提供了一个统一的 API 接口,支持访问和使用多种知名 AI 模型,包括但不限于 GPT-4、Claude、Google PaLM、LLama 等。这些模型覆盖了自然语言处理、计算机视觉、聊天机器人、内容生成等多个领域,用户可以根据需求选择最适合的模型进行调用。 OpenRoute官网入口网址:https://openrouter.ai/ 功能与特点: 统一接口:OpenRouter 提供了一个统一的 API 接口,使用户能够轻松调用多种大型语言模型(LLMs),如 GPT-4、Claude 和 Google PaLM 等。多样化的模型选择:平台支持多种开源和商业 AI 模型,包括 Llama-3、Mixtral、Anthropic 的 Claude 和 OpenAI 的 GPT-3.5 和 GPT-4 等。灵活的定价计划:OpenRouter 提供灵活的定价模式,部分模型按使用次数收费,而像 Claude 2 这样的模型则采用包月制。无代码网页应用封装:平台支持无代码网页应用封装,方便开发者快速集成 AI 功能。实验实验室与集成支持:OpenRouter 提供实验实验室功能,并支持与各种应用和框架的集成,如 Streamlit 和 LangChain。 应用场景: AI 写作助手:用户可以利用 OpenRouter 开发 AI 写作助手,提升内容创作效率。多模型聊天机器人:通过 OpenRouter,开发者可以构建多模型聊天机器人,提供更丰富和智能的对话体验。AI 模型比较工具:OpenRouter 允许用户比较不同模型的性能和价格,帮助用户选择最适合的模型。定制 AI 应用:用户可以利用 OpenRouter 开发定制化的 AI 应用,满足特定业务需求。 技术优势: 兼容性:OpenRouter 与 OpenAI 的 SDK 兼容,便于开发者在不同平台间无缝切换。成本透明:平台仅收取上游供应商的费用而不加价,为研究人员和初创企业提供了成本效益高的选择。高上下文长度支持:OpenRouter 支持高上下文长度的模型,如 GPT-4,能够处理更复杂的任务。边缘优化:平台通过边缘优化技术提升响应质量。 用户体验: 用户友好的界面:OpenRouter 提供了用户友好的界面,使用户能够轻松浏览、搜索和选择模型。实时交互:用户可以与模型进行实时对话,获取即时建议和回答。评价功能:用户可以对已使用过的模型进行评价和反馈,帮助其他用户做出更好的选择。 适用人群: AI 开发者:OpenRouter 提供了丰富的 API 接口和工具,适合 AI 开发者快速搭建和测试 AI 应用。研究人员:研究人员可以利用 OpenRouter 进行模型比较和性能测试,优化 AI 应用程序的性能和成本。企业和教育机构:企业和教育机构可以利用 OpenRouter 提高开发效率、降低成本,并为用户提供高质量的 AI 服务。 使用方法: 注册与获取 API 密钥:用户需要注册 OpenRouter 账号并获取 API 密钥,以便调用平台提供的 API 服务。配置与调用:通过简单的配置和调用,用户可以轻松访问多种预训练的大模型。免费试用与充值:OpenRouter 提供免费试用服务,并支持充值以获取更多使用额度。 OpenRouter 是一个强大且灵活的 AI 模型访问平台,为用户提供了一个统一的接口和多样化的模型选择,适用于个人开发者、企业和教育机构等多种用户群体。通过其用户友好的界面和灵活的定价模式,OpenRouter 成为 AI 开发和研究的重要工具。

RAGFlow
RAGFlow

RAGFlow 是一个基于深度文档理解的开源检索增强生成(Retrieval-Augmented Generation, RAG)引擎,旨在为企业提供高效、准确的问题回答和数据推理能力。 RAGFlow官网入口网址:https://ragflow.io/RAGFlow开源项目地址:https://github.com/infiniflow/ragflow核心功能与特点 RAGFlow结合了大型语言模型(LLM)和深度文档理解技术,能够从各种复杂格式的文档中提取关键信息,并生成高质量的答案。其主要特点包括: 智能文本处理:RAGFlow支持多种文本模板和文件类型,如Word、PPT、Excel、PDF、图片、表格等,能够自动识别文档布局,包括标题、段落、换行等,确保数据的高质量输入和输出。有根据的回答:通过引用文档中的关键信息,RAGFlow能够生成有根据的答案,减少幻觉风险,提高回答的可靠性和可解释性。灵活的工作流:RAGFlow提供简化的RAG工作流程,支持文本到SQL的转换、图RAG和思维导图的灵感生成,适用于个人应用至大型企业生态系统。多模态支持:除了文本,RAGFlow还支持图片、表格等多媒体内容的处理,进一步扩展了其应用场景。可配置性与扩展性:用户可以根据需求配置嵌入模型和LLMs,支持多种重排序算法(如Agentic RAG、Self-RAG、BCE和BGE),并提供API接口以实现与业务系统的无缝集成。技术架构 RAGFlow的技术架构分为多个层次,包括系统配置、服务配置、Docker Compose文件等。具体步骤如下: 系统配置:用户需要准备所需的硬件资源,如CPU、内存和GPU,并确保操作系统和Docker环境的兼容性。服务配置:通过Docker Compose文件定义服务,包括RAGFlow服务、前端服务和后端服务等。部署与运行:用户可以通过构建Docker镜像、安装依赖库和配置环境变量来部署RAGFlow。成功部署后,用户可以通过特定URL或浏览器登录系统,确认是否成功启动。应用场景 RAGFlow适用于多种场景,包括但不限于: 企业内部知识管理:通过RAGFlow,企业可以快速从大量文档中提取关键信息,支持内部知识管理和文档解析。学术研究:RAGFlow能够帮助研究人员从复杂的学术文档中提取信息,支持文献综述和研究资料整理。个人助手:RAGFlow可以作为个人助手,提供基于文档的问答服务,帮助用户解决日常问题。社区支持与贡献 RAGFlow鼓励社区贡献,用户可以通过GitHub等平台参与开发和改进。社区提供了丰富的文档和教程,帮助用户快速上手和解决问题。 使用方式 RAGFlow支持两种使用方式: 自行部署:适合有一定技术基础的用户,需要满足一定的硬件要求,并按照官方文档进行配置和部署。使用官网:适合没有技术背景的用户,可以直接访问官网试用demo,体验RAGFlow的强大功能。 RAGFlow凭借其强大的功能和灵活的工作流,正在迅速成为文本处理和问答领域的佼佼者。无论是企业还是个人用户,都可以通过RAGFlow实现高效、准确的文档处理和问答服务。

FireRedTTS
FireRedTTS

FireRedTTS 是由小红书技术团队开发的一款基于大语言模型的语音合成系统,旨在为用户提供高效、多样化的语音生成解决方案。该系统的核心特点在于其无需训练,仅需提供几秒钟的参考音频和文本输入,即可生成高质量的语音内容。FireRedTTS 的技术框架包括数据处理、基础系统和下游应用三个部分,能够生成多风格、高表现力的音色,适用于短视频配音、聊天式语音对话等多种场景。 FireRedTTS官网入口网址:https://fireredteam.github.io/demos/firered_tts/FireRedTTS开源项目地址:https://github.com/FireRedTeam/FireRedTTS 技术特点: 多音色模仿:FireRedTTS能够模仿多种音色,包括萝莉音、御姐音、磁性大叔音等,满足不同用户的需求。无需训练:用户只需提供几秒钟的参考音频,即可生成个性化的语音内容,无需复杂的训练过程。快速生成:仅需几秒钟参考音频,即可快速生成高质量的语音内容。风格多样:支持多种风格的语音生成,如搞笑、温柔、霸气等,适用于多种情感和场景需求。 应用场景: 短视频配音:FireRedTTS在短视频配音中表现出色,能够生成符合角色特点的配音内容。聊天机器人:通过FireRedTTS生成的语音可以用于聊天机器人,提供自然且个性化的交互体验。教育工具:适用于在线客服系统和教育工具,提升用户体验。 技术实现: FireRedTTS基于大语言模型构建,具有出色的上下文学习能力,能够稳定地合成与提示文本和音频一致的高质量语音。系统支持多种语言的文本合成,适用于中英文跨语言克隆。提供详细的安装步骤和环境配置指南,用户可以通过Hugging Face平台获取预训练检查点和推理代码。 开源与社区支持: FireRedTTS是一个开源项目,用户可以从GitHub下载源代码并进行个性化定制。社区提供了丰富的文档和技术支持,帮助用户快速上手和优化使用体验。 实际案例: 在短视频配音中,FireRedTTS能够生成京腔、中英文混杂等多样化的语音内容,提升内容的生动性和趣味性。在聊天机器人应用中,FireRedTTS可以根据不同需求生成具有特定风格和情感的语音,增强用户的互动体验。 FireRedTTS是一款功能强大且易于使用的AI语音合成工具,适用于多种场景和需求。其核心技术基于大语言模型,能够快速生成高质量的语音内容,并支持多音色模仿和多样化风格生成。用户可以通过开源项目获取更多功能和定制选项。

AstrBo
AstrBo

AstrBot 是一个松耦合、异步、支持多消息平台部署、具有易用的插件系统和完善的大语言模型(LLM)接入功能的聊天机器人及开发框架。 AstrBo官网入口网址:https://astrbot.app/ AstrBo开源项目地址:https://github.com/Soulter/AstrBot 主要功能 大语言模型对话。支持各种大语言模型,包括 OpenAI API、Google Gemini、Llama、Deepseek、ChatGLM 等,支持接入本地部署的大模型,通过 Ollama、LLMTuner。具有多轮对话、人格情境、多模态能力,支持图片理解、语音转文字(Whisper)。多消息平台接入。支持接入 QQ(OneBot)、QQ 频道、微信(Gewechat)、飞书、Telegram。后续将支持钉钉、Discord、WhatsApp、小爱音响。支持速率限制、白名单、关键词过滤、百度内容审核。Agent。原生支持部分 Agent 能力,如代码执行器、自然语言待办、网页搜索。对接 Dify 平台,便捷接入 Dify 智能助手、知识库和 Dify 工作流。插件扩展。深度优化的插件机制,支持开发插件扩展功能,极简开发。已支持安装多个插件。可视化管理面板。支持可视化修改配置、插件管理、日志查看等功能,降低配置难度。集成 WebChat,可在面板上与大模型对话。高稳定性、高模块化。基于事件总线和流水线的架构设计,高度模块化,低耦合。 AstrBo提供了一个强大、灵活且易于部署的消息平台解决方案,适用于各种规模的企业和个人用户。

Midscene.js
Midscene.js

Midscene.js 是一款由人工智能驱动的自动化 SDK,旨在简化 UI 自动化测试流程,提升测试效率和质量。它通过自然语言交互、多模态大语言模型(LLM)和可视化工具等核心功能,为开发者提供了一种高效、直观的自动化测试解决方案。 Midscene.js官网入口网址:https://midscenejs.com/zh/index.html Midscene.js开源项目地址:https://github.com/web-infra-dev/midscene 核心功能与特点 自然语言交互:用户可以通过自然语言描述操作步骤,Midscene.js 将自动规划并控制用户界面。例如,用户可以输入“点击登录按钮”,Midscene.js 会根据页面内容自动执行点击操作。支持对数据格式的提示,用户可以要求以 JSON 格式返回预期结果,从而实现更精确的数据提取和断言。多模态大语言模型支持:Midscene.js 支持使用公共多模态 LLM(如 GPT-4)和开源模型(如 UI-TARS),无需自定义训练即可快速上手。这种设计降低了使用门槛,使得非技术背景人员也能轻松参与测试工作。直观断言:用户可以用自然语言表达断言,Midscene.js 基于 AI 理解并执行这些断言,减少了编写复杂断言逻辑的需求,提高了测试的准确性和可靠性。可视化报告与调试工具:Midscene.js 提供详细的可视化报告,帮助用户轻松理解和调试整个测试过程。报告中包含每个步骤的执行情况和结果,便于快速定位问题。内置 Playground 功能允许用户在不重新加载页面的情况下调整测试脚本,进一步提升了调试效率。高集成性与灵活性:Midscene.js 支持与多种工具集成,包括 Puppeteer、Playwright 和 YAML 脚本等,适用于多种自动化测试场景。用户可以选择公共或私有部署模式,确保数据安全性和隐私保护。开源与社区支持:Midscene.js 是一个开源项目,用户可以在 GitHub 上获取源码并参与贡献。官方网站提供了快速体验指南、API 参考文档和可视化工具,帮助用户快速上手。 应用场景 Midscene.js 适用于多种自动化测试场景,包括但不限于: 自动化测试:通过自然语言描述测试步骤,Midscene.js 自动执行操作并生成测试报告。数据抓取:从网页中提取关键信息并以结构化格式输出。性能监控:实时监控网页性能指标,及时发现潜在问题。界面一致性检查:确保网页界面在不同设备和浏览器上的表现一致。 技术原理 Midscene.js 的技术原理基于自然语言处理(NLP)、界面理解技术和多模态大语言模型(LLM)。通过解析用户的自然语言指令,Midscene.js 能够理解用户意图并生成相应的操作步骤。这一过程涉及以下几个关键步骤: 自然语言解析:将用户的自然语言描述转换为具体的操作指令。界面理解:通过 AI 技术分析网页内容,确定操作目标。数据提取与断言:根据用户需求提取数据,并生成断言以验证测试结果。 使用方法 安装 Chrome 插件:用户可以通过访问 Midscene.js 官网下载并安装 Chrome 插件。编写测试脚本:在插件中输入自然语言描述的操作步骤,Midscene.js 将自动执行并生成测试报告。调试与优化:利用可视化报告和 Playground 功能,用户可以轻松调试和优化测试脚本。 Midscene.js 是一款革命性的 UI 自动化测试工具,通过 AI 技术简化了测试流程,降低了学习曲线。它不仅提升了测试效率和准确性,还为非技术背景人员提供了参与测试的可能性。无论是自动化测试、数据抓取还是性能监控,Midscene.js 都能提供强大的支持。通过开源社区的支持和丰富的集成选项,Midscene.js 成为了开发者和测试工程师的理想选择。

MindSearch
MindSearch

MindSearch 是一款由上海人工智能实验室研发的开源 AI 搜索引擎框架,旨在通过模仿人类思维和行为,高效地处理复杂的信息检索任务。其核心功能包括大规模信息搜集与整理能力、多智能体框架设计以及透明的解决方案路径展示,使其在学术研究、市场分析、新闻报道、法律研究和技术支持等多个领域具有广泛的应用价值。 MindSearch项目官网入口网址:https://github.com/InternLM/MindSearch MindSearch项目中文官网入口网址:https://github.com/InternLM/MindSearch/blob/main/README_zh-CN.md 1. 核心功能与特点 多智能体框架:MindSearch采用多智能体设计,主要由WebPlanner和WebSearcher两个核心组件组成。WebPlanner负责将用户查询分解为子问题,并构建动态图结构;WebSearcher则负责执行搜索任务,从多个网页中提取有价值的信息。高效信息搜集:MindSearch能够在3分钟内从300多个网页中高效搜集有效信息,通常需要人类3小时才能完成的任务。动态图构建:通过有向无环图(DAG)的方式,MindSearch将复杂查询分解为可并行处理的子问题,显著提高了信息聚合效率。分层检索策略:MindSearch采用分层检索策略,优化了信息的准确性和完整性。透明解决方案路径:MindSearch提供详细的解决方案路径,用户可以查看所有公开细节,从而提高回复的可信度和可用性。 2. 技术实现 底层模型支持:MindSearch支持多种大型语言模型(LLM),包括闭源的GPT和Claude,以及开源的InternLM2.5-7B等。开源与可扩展性:MindSearch完全开源,用户可以免费体验和部署。其代码托管在GitHub上,支持自定义部署和多语言模型代理。用户界面:MindSearch提供多种用户界面选项,包括React、Gradio、Streamlit和本地调试等,方便不同技术背景的用户使用。 3. 应用场景 学术研究:MindSearch能够帮助研究人员快速找到相关文献和数据,支持复杂的学术查询。商业决策:通过深度知识探索和透明解决方案路径,MindSearch为商业决策提供有力支持。新闻报道与法律研究:MindSearch能够快速筛选关键信息并整理成逻辑连贯的知识模块,适用于新闻报道和法律研究。教育学习:MindSearch可以帮助学生快速获取学习资料,支持教育领域的深度知识探索。 4. 性能与优势 响应质量:MindSearch在深度、广度和事实准确性方面显著优于其他搜索引擎,如ChatGPT-Web和Perplexity.ai Pro。时间效率:与人类标签者相比,MindSearch在处理复杂问题时仅需23分钟,而人类标签者需要19小时17分钟。错误修正能力:MindSearch具备自我纠正功能,能够在无法找到所需信息时直接生成响应节点,避免陷入重复循环。 5. 开源社区与未来展望 社区支持:MindSearch项目在GitHub上受到广泛关注,用户可以通过贡献代码和反馈来推动其发展。未来方向:MindSearch计划进一步优化用户体验,支持更多功能,如视觉输入和网页交互。 6. 注意事项 版权与使用限制:虽然MindSearch是开源项目,但部分内容可能涉及版权问题,用户需谨慎使用。部署要求:用户需要安装Python环境,并根据需求配置FastAPI服务器。 MindSearch是一款功能强大、性能卓越的开源AI搜索引擎框架,通过模仿人类思维过程,实现了高效的信息搜集与整合。其多智能体设计、动态图构建和分层检索策略使其在学术研究、商业决策、新闻报道等多个领域具有广泛的应用潜力。

Diffutoon
Diffutoon

Diffutoon 是一种由阿里巴巴达摩院与华东师范大学联合研发的先进动漫风格渲染技术,旨在将真实视频转换为逼真的动漫风格。该技术基于扩散模型(Diffusion Model),通过学习大量图片数据生成新的图像和视频,从而实现高分辨率、高一致性和可编辑的卡通着色效果。 Diffutoon官网入口网址:https://ecnu-cilab.github.io/DiffutoonProjectPage/ Diffutoon开源项目地址:https://github.com/modelscope/DiffSynth-Studio Diffutoon 的核心优势在于其能够处理高分辨率和快速运动的视频,同时保持内容的一致性和视觉吸引力。其技术流程包括风格化、一致性增强、结构指导和着色四个关键子问题的解决。通过多模块去噪模型、控制网络、动画滑动扩散、快速注意力机制等技术手段,Diffutoon 能够生成高质量的动漫风格视频。 Diffutoon 的主要功能包括: 高分辨率输出:支持高达 1536 x 1536 的分辨率,适用于高分辨率和快速运动的视频。内容一致性:通过控制网络和动画滑动扩散技术,确保视频帧间的一致性和连贯性。智能编辑:用户可以通过编辑分支根据提示生成彩色视频信号,实现个性化内容创作。自动着色:根据视频内容和风格要求自动选择合适的颜色填充,确保颜色协调性和视觉吸引力。超分辨率与上色:即使输入视频分辨率较低,也能生成高质量的动漫风格视频。 Diffutoon 的应用场景广泛,包括动画制作、视频游戏开发、电影后期制作、虚拟现实和增强现实、社交媒体内容创作、广告和营销、教育和培训等领域。此外,Diffutoon 的代码和模型已开源,用户可以通过 GitHub 平台访问并体验其功能。 Diffutoon 是一项革命性的视频转绘技术,为创作者提供了强大的工具,使他们能够轻松将真实视频转化为具有动漫风格的高质量作品。其开源特性进一步推动了技术的普及和发展,为数字创意领域带来了无限可能。

IDM-VTON
IDM-VTON

IDM-VTON(Improved Diffusion Models for Virtual Try-on)是一款由韩国科学技术院(KAIST)与OMNI.AI联合开发的先进虚拟试穿技术。该项目通过改进扩散模型,生成逼真的虚拟试穿图像,为用户提供接近现实的试衣体验。其核心技术包括视觉编码器和UNet模型,能够捕捉服装的纹理、图案和缝线等细节,同时支持复杂背景处理和一致性保持。 IDM-VTON官网入口网址:https://idm-vton.github.io/IDM-VTON开源项目网址:https://github.com/yisol/IDM-VTONIDM-VTON在线演示网址:https://huggingface.co/spaces/yisol/IDM-VTON IDM-VTON的主要特点包括高度真实感、复杂背景处理能力和细节保留能力。例如,在户外或背景复杂的场景中,该技术仍能准确展示衣物试穿效果,保持图像高质量。此外,IDM-VTON还支持个性化定制,用户可以通过文本提示等方式调整生成图像的效果,进一步提高图像的一致性和真实性。 IDM-VTON的应用场景广泛,包括时尚零售、个性化推荐、在线试衣间、广告展示以及虚拟现实和游戏等领域。例如,在时尚零售中,品牌可以利用IDM-VTON创建逼真的虚拟模特来展示服装,从而降低拍摄成本并提升用户体验。在虚拟现实和游戏中,该技术则可用于创建个性化的角色服装,增强沉浸式体验。 IDM-VTON的技术原理基于图像编码、高级语义提取、低级特征提取、注意力机制和详细文本提示等技术。其生成过程包括数据准备、模型训练、模型微调、评估优化、部署应用和持续迭代等多个步骤。用户可以通过Hugging Face平台访问IDM-VTON的在线空间,无需复杂的本地安装和配置即可体验虚拟试穿功能。 IDM-VTON项目还提供了多种资源和支持,包括GitHub源码库、Hugging Face Demo和arXiv研究论文等。用户可以通过访问其官网(https://idm-vton.github.io/ )获取更多信息和试玩地址。 IDM-VTON作为一款AI虚拟试衣工具,不仅提升了用户的试衣体验,还为时尚行业和相关领域带来了创新解决方案。其高保真度和灵活性使其成为当前虚拟试穿技术领域的领先者。

AniPortrait
AniPortrait

AniPortrait 是由腾讯游戏智迹团队研发的一款开源 AI 工具,旨在通过音频和参考肖像图像生成高质量的动态视频动画。该项目的核心功能是将静态肖像转化为生动的动画形象,同时支持音频驱动的面部表情和头部姿势控制,使生成的动画与输入音频同步,呈现出逼真的视觉效果。 AniPortrait项目官网入口网址:https://github.com/Zejun-Yang/AniPortraitAniPortrait在线演示网址:https://huggingface.co/spaces/ZJYang/AniPortrait_official AniPortrait 的工作流程分为两个主要阶段:首先是 Audio2Lmk(音频到 2D 面部标记点),该模块从音频中提取关键信息,包括面部表情和头部姿态的 3D 网格和头部姿态信息;其次是 Lmk2Video(2D 面部标记点到视频),该模块利用提取的面部特征生成高质量的动态视频。此外,AniPortrait 还支持人脸重绘功能,允许用户将照片中的人物替换到源视频中,从而实现更加灵活的动画创作。 AniPortrait 的技术特点包括: 音频驱动的动画合成:通过分析音频中的语音节奏和音调,自动调整人物的面部表情和口型,使其能够说话或唱歌。高质量的视觉效果:利用扩散模型和运动模块,生成高分辨率、时间一致性的逼真动画。灵活的模型配置:用户可以根据需求调整模型权重和配置参数,以实现个性化的动画效果。广泛的应用场景:适用于游戏开发、虚拟主播、社交媒体内容创作、艺术创作等多个领域。 AniPortrait 的开源特性使其具有较高的灵活性和扩展性。用户可以通过 GitHub 获取代码并进行定制开发,同时社区提供了详细的文档和支持,帮助新手快速上手。此外,AniPortrait 还支持多种语言,并且能够适应不同的硬件配置,进一步提升了其普适性和实用性。 AniPortrait 是一个功能强大且灵活的 AI 动画生成工具,能够满足用户在动态视频制作中的多样化需求。无论是专业人士还是普通用户,都可以通过 AniPortrait 创作出独一无二的艺术作品或实用内容。

DreamTalk
DreamTalk

DreamTalk是一款由清华大学、阿里巴巴集团和华中科技大学联合开发的创新人工智能技术,专注于通过扩散模型将人物照片转化为具有动态说话效果的虚拟形象。该项目的核心目标是创建一个框架,使人物头像能够模仿不同声音,实现逼真的虚拟角色表情和动作,适用于影视制作和人机交互场景。 DreamTalk官网入口网址:https://dreamtalk-project.github.io/DreamTalk开源项目地址:https://github.com/ali-vilab/dreamtalk DreamTalk的技术架构由三个关键组件构成:降噪网络、风格感知唇部专家和风格预测器。降噪网络通过扩散模型去除噪声,生成高质量的面部动画;风格感知唇部专家分析说话风格,确保嘴唇动作自然且符合整体风格;风格预测器则直接从音频预测目标表情,减少对外部表情参考的需求。这种技术组合使得DreamTalk能够生成具有丰富表情和准确唇同步的逼真说话头像,支持多种语言、歌曲、嘈杂音频以及非领域肖像。 DreamTalk的主要功能包括: 多语言支持:支持中文、日语、法语、德语等多种语言的情感表达。跨时空对话生成:能够生成不同情感状态的动画,如愤怒的达芬奇或快乐的蒙娜丽莎。高质量动画生成:生成的视频质量高,表情真实且富有感染力。广泛的应用场景:适用于影视制作、教育、广告、娱乐等领域,甚至可以用于跨文化对话和语言学习。 该项目还具有开源特性,开发者可以通过GitHub获取代码和相关资源,进一步探索和优化技术。 DreamTalk的开源不仅推动了语音合成技术的发展,也为研究人员和开发者提供了更多可能性。 DreamTalk通过先进的扩散模型和创新的技术架构,实现了将人物照片转化为动态说话头像的突破性成果,为人工智能在影视制作、人机交互和跨文化交流等领域的应用开辟了新的可能性。

MotionAgent
MotionAgent

MotionAgent是一款由阿里云魔搭社区(ModelScope)开发的开源AI工具,旨在通过深度学习技术将用户的创意转化为动态影像内容。其核心功能包括剧本生成、剧照生成、视频制作和背景音乐生成,适用于个人创作者、内容创作者以及电影制作团队等用户群体。 MotionAgent项目官网入口网址:https://github.com/modelscope/motionagentMotionAgent中文入口网址:https://github.com/modelscope/motionagent/blob/main/README_ZH.md 核心功能与特点 剧本生成:用户可以通过指定故事主题和背景,生成多种风格的剧本。MotionAgent支持基于LLM(如Qwen-7B-Chat)的模型,能够高效生成高质量的剧本内容。剧照生成:用户输入剧本后,MotionAgent可以自动生成相应的剧照场景图像。这一功能依赖于文本生成图片模型(如I2VGen-XL),能够将文字描述转化为视觉内容。视频生成:MotionAgent支持高分辨率视频生成,结合SDXL 1.0等模型,能够将文本或图像输入转化为流畅的动态影像。背景音乐生成:用户还可以自定义风格的背景音乐,通过音乐生成模型(如MusicGen)实现音频内容的创作。 使用流程 用户输入创意描述(如故事主题、背景和剧情要求)。MotionAgent根据输入生成剧本。通过剧照生成模块,将剧本转化为静态画面。将静态画面和补充文本描述上传至视频生成模块,生成最终视频。最后,用户可以选择自定义背景音乐,完成整个创作过程。 优势与应用场景 简化创意过程:MotionAgent通过AI技术减少了手动劳动,使用户能够快速将创意转化为高质量的动态内容。适用范围广泛:从个人创作者到专业电影制作团队,均可利用MotionAgent实现高效创作。开源与免费:作为开源项目,MotionAgent允许用户自由修改和分发代码,降低了使用门槛。 MotionAgent是一款功能强大的AI视频生成工具,通过整合多种深度学习模型,实现了从创意到动态影像的自动化转换。其开源特性、免费使用政策以及对多种硬件和环境的支持,使其成为创意工作者和电影制作团队的理想选择。

EmotiVoice易魔声
EmotiVoice易魔声

EmotiVoice易魔声是一款由网易有道AI算法团队开发的开源文本转语音(TTS)引擎,支持中英文双语,拥有超过2000种音色和情感合成功能。这款引擎通过深度学习技术实现了高度个性化的语音生成,能够根据用户输入的文本内容和情感提示,生成包含快乐、兴奋、悲伤、愤怒等广泛情感的语音,从而让语音更加自然逼真。 EmotiVoice易魔声项目官网入口网址:https://github.com/netease-youdao/EmotiVoiceEmotiVoice易魔声中文入口网址:https://github.com/netease-youdao/EmotiVoice/blob/main/README.zh.md EmotiVoice的主要特点包括: 多语言支持:支持中文和英文,满足不同用户的语言需求。情感合成功能:用户可以通过简单的文本提示实现情感切换,使语音更具表现力。例如,可以生成快乐、兴奋、悲伤、愤怒等多种情绪的语音。丰富的音色选择:提供超过2000种音色,涵盖从细腻温柔到铿锵有力的不同风格,适用于多种场景。易用性:提供简洁的Web界面和批量生成结果的脚本接口,用户无需复杂配置即可快速上手。开源与免费:作为开源项目,所有用户均可免费下载使用,并可在GitHub上获取源代码。离线运行:提供离线整合包(如EmotiVoice-Plus),支持本地运行,确保数据安全。应用场景广泛:适用于有声书制作、虚拟助理、教育软件、游戏配音以及日常娱乐聊天等领域。 EmotiVoice还支持多种安装方式,包括Docker镜像安装和完整安装,用户可根据需求选择适合的方式。此外,开发者可以通过脚本接口进行批量生成,进一步提升效率。 EmotiVoice易魔声以其强大的功能、丰富的音色选择和情感合成功能,成为一款极具潜力的开源TTS引擎,为用户提供了一个高效、便捷且免费的语音生成解决方案。

PoloAPI
PoloAPI

PoloAPI是海内外大模型聚合API服务商,提供多模型调用支持与成本优化方案​。高性价比AI大模型API 聚合服务,Claude、OpenAI 等源头直供!! PoloAPI官网入口网址:https://poloapi.com/ PoloAPI 是一个专业的 AI 大模型聚合服务平台,旨在为开发者和企业提供稳定、高效、便捷的 AI 模型调用服务。它支持多种主流大模型,如 Claude、OpenAI、Gemini、Grok、Deepseek 等,通过统一的接口简化了模型的接入流程,降低了开发和使用门槛 。 PoloAPI 提供了丰富的功能,包括统一的 API 接口、实时监控、智能调度、安全可靠的数据保护、灵活的扩展能力以及完善的文档支持,帮助用户高效地调用和管理 AI 模型 。此外,PoloAPI 还支持多种开发工具和平台的集成,如 VS Code、Cursor、Cherry Studio 等,方便开发者快速上手和使用 。 在使用方面,PoloAPI 提供了详细的使用教程和示例代码,帮助用户快速上手。例如,用户可以通过简单的 API 调用示例快速体验模型的调用方式,并通过控制台进行额度管理、模型选择和参数配置等操作 。此外,PoloAPI 还提供了安全实践和计费说明,帮助用户合理规划和使用资源 。 PoloAPI 作为 AI 大模型聚合服务站,不仅解决了国内用户访问海外模型的限制问题,还提供了稳定、高效、经济的使用体验,是开发者和企业进行 AI 应用开发的重要工具 。

WeKnora
WeKnora

WeKnora 是腾讯开源的一个文档理解与语义检索框架,旨在帮助用户更高效地处理和利用文档信息。 WeKnora官网入口网址:https://weknora.weixin.qq.com/WeKnora开源项目地址:https://github.com/Tencent/WeKnora WeKnora 的核心功能是将文档转化为可对话的知识库,支持多种文档格式(如 PDF、Word、图片等)的解析与处理,结合大语言模型和向量检索技术,实现智能问答和知识检索。它支持多模态解析、多模态认知引擎、灵活的 RAG 流水线设计、多模型切换和私有化部署等功能,适用于企业知识管理、科研分析、法律审查、医疗知识辅助等多个场景 。 WeKnora 采用模块化设计,包含文档处理、知识建模、检索引擎、推理生成和交互展示等核心模块,支持灵活配置和扩展,适用于不同行业和企业的定制化需求 。其模块化架构使得开发者可以轻松集成到现有系统中,或根据特定需求进行功能扩展 。 WeKnora 提供了直观的 Web 界面,支持用户无需编程即可轻松使用,支持文档上传、知识库管理、智能问答体验等功能,支持多轮交互和精准答案展示 。此外,WeKnora 采用 MIT 许可证开源,社区用户可以自由使用、修改和商业化 。 WeKnora 的目标是通过 AI 技术解决文档管理中的复杂问题,提升信息检索和知识利用的效率,为各行各业提供强大的技术支持 。

小智 AI 聊天机器人
小智 AI 聊天机器人

小智 AI 聊天机器人是一款开源硬件项目,旨在帮助用户入门 AI 硬件开发,并将大语言模型(LLM)应用于实体设备中。该项目由开发者“虾哥”以 MIT 许可证发布,具有低成本、高可玩性,适合 AI 硬件开发学习者使用 。项目支持 Wi-Fi 和 4G 连接,具备离线语音唤醒、流式语音对话、多语言识别(包括国语、粤语、英语、日语、韩语)、声纹识别、LLM 和 TTS 支持、短期记忆功能,以及 OLED/LCD 显示屏显示对话内容 。项目提供详细视频教程,用户可自行制作硬件和工具进行体验 。 小智 AI 聊天机器人官网入口网址:https://xiaozhi.me/小智 AI 聊天机器人开源项目地址:https://github.com/78/xiaozhi-esp32小智 AI 聊天机器人百科全书:链接 小智 AI 聊天机器人支持多种功能,包括语音唤醒(支持离线唤醒和按键唤醒)、多语言识别、流式语音对话、多模态交互方式等 。用户可以通过视频教程和固件修改进行自定义和扩展功能。此外,该项目还支持私有化服务器部署和定制模型应用。 小智 AI 聊天机器人不仅是一个开源硬件项目,还具有一定的娱乐性和实用性,例如在视频中展示其与用户互动、讲笑话、唱歌等功能。此外,该项目还支持与智能家居设备(如 Home Assistant)的集成,实现智能家居控制。 小智 AI 聊天机器人是一个集开源硬件、AI 技术、娱乐性和实用性于一体的项目,适合对 AI 硬件开发和智能设备感兴趣的用户。开发和智能设备感兴趣的用户。

Gemini CLI
Gemini CLI

Gemini CLI 是一个开源的 AI 代理,旨在将 Gemini 模型的强大功能直接集成到终端中,为开发者提供高效、便捷的 AI 助手 。它支持代码生成、问题解决、深度研究和任务管理等多种功能,并且与 Google 的 AI 编程助手 Gemini Code Assist 共享底层技术 。 Gemini CLI官网入口网址:https://google-gemini.github.io/gemini-cli/Gemini CLI开源项目地址:https://github.com/google-gemini/gemini-cli Gemini CLI 的核心功能包括: 代码生成与编辑:支持在终端中直接提问、编写代码、解释错误和优化代码,还可处理非代码问题和图片分析 。多模态能力:支持多模态生成应用,如从 PDF 或草图快速生成应用程序原型 。自动化任务:支持自动化工作流、文件操作、代码编辑、网络请求等功能 。扩展性:支持 MCP 协议、自定义提示词、插件扩展,以及与 VS Code 的集成 。安全性与配置:提供沙箱执行环境、上下文文件管理、多环境适配等安全与配置功能 。 安装与使用方面,Gemini CLI 需要 Node.js 18 或更高版本,通过 npm 或 npx 安装,支持全局安装或命令行调用 。用户需登录 Google 账户或设置 API 密钥以获取 API 访问权限 。免费使用额度为每分钟 60 次、每日 1000 次,超出后可切换至 Gemini 2.5 Pro 模型 。 Gemini CLI 是一个功能强大且灵活的命令行工具,适合开发者在终端中高效地利用 AI 助手完成各种任务。

awesome-llm-apps
awesome-llm-apps

awesome-llm-apps 是一个开源项目,旨在收集和展示基于大型语言模型(LLM)的应用程序,特别是那些结合了检索增强生成(RAG)和AI代理技术的应用。该项目由 Shubhamsaboo 创建并维护,旨在为开发者提供一个展示和探索LLM应用的平台。 awesome-llm-apps项目官网入口网址:https://github.com/Shubhamsaboo/awesome-llm-appsawesome-llm-apps项目中文介绍:https://www.readme-i18n.com/zh/Shubhamsaboo/awesome-llm-apps 该项目涵盖了多种应用领域,包括AI代理、多代理团队、RAG(检索增强生成)、语音代理等技术,可本地运行。这些应用包括AI博客播客代理、AI分手恢复代理、AI数据分析代理、AI医疗影像代理、AI表情包生成代理、AI音乐生成代理、AI旅行代理等。此外,项目还提供了详细的文档和安装指南,用户可以克隆仓库并按照README文件安装依赖运行应用。 awesome-llm-apps 项目支持多种模型,包括OpenAI、Anthropic、Gemini和开源模型(如DeepSeek、Qwen、Llama)等,这些模型可以用于构建更强大、更智能的应用。项目还提供了多种教程和示例,帮助开发者快速上手和开发LLM应用。 awesome-llm-apps 项目鼓励社区贡献,用户可以提交新项目或改进现有项目,保持结构一致并附详细说明。项目持续更新,建议星标以获取最新应用。 awesome-llm-apps 是一个开源项目,旨在收集和展示基于大型语言模型(LLM)的应用程序,特别是那些结合了检索增强生成(RAG)和AI代理技术的应用。该项目为开发者提供了一个展示和探索LLM应用的平台,涵盖了多种应用领域和模型支持。

MCP Feedback Enhanced
MCP Feedback Enhanced

MCP Feedback Enhanced 是一个基于 Model Context Protocol (MCP) 的反馈驱动开发工具,旨在通过用户交互式反馈优化 AI 模型的开发流程。它支持多种界面(Web UI 和桌面应用),适用于本地、远程和 WSL 环境。 MCP Feedback Enhanced开源项目官网入口网址:https://github.com/Minidoracat/mcp-feedback-enhancedMCP Feedback Enhanced中文介绍:链接主要功能与特点 1. 双界面支持 Web UI:轻量级浏览器界面,适合远程和 WSL 环境。桌面应用:基于 Tauri 框架,支持 Windows、macOS 和 Linux,提供原生体验。 2. 核心功能 AI 交互:支持提示选择、文本输入、图像上传、自动提交。实时反馈:WebSocket 连接,实时传递信息。会话管理:会话记录、统计、导出(JSON、CSV、Markdown)。自动化:定时提交、命令执行、会话管理。多语言支持:支持中文(简体、繁体)、英文。 3. 技术架构 跨平台:支持 Windows、macOS、Linux。部署灵活:支持 SSH 远程、WSL 环境。配置灵活:环境变量配置(如 MCP_WEB_HOST、MCP_LANGUAGE)。 4. 开发与测试 测试工具:提供单元测试、功能测试、覆盖率报告。构建与部署:支持桌面应用打包(v2.5.0 新增)。缓存管理:UV 缓存清理工具。使用场景与问题解决 常见问题与解决方案 SSH 远程环境问题:通过 MCP_WEB_HOST 设置或 SSH 端口转发解决。WebSocket 问题:刷新页面或检查连接状态。图像解析问题:AI 模型限制,建议重试或调整图像格式。 MCP Feedback Enhanced 是一个功能强大、灵活且用户友好的工具,适合开发者在 AI 开发中进行交互式反馈和优化。其跨平台支持、多语言能力以及丰富的功能使其成为 AI 开发流程中的重要工具。

AgenticSeek
AgenticSeek

AgenticSeek是一个100%本地运行的 Manus AI 替代品,支持语音的 AI 助手,可自主浏览网页、编写代码、规划任务,所有数据仅保存在你的设备上。专为本地推理模型设计,完全在你的硬件上运行,确保隐私无忧,无需云端依赖。 AgenticSeek官网入口网址1:https://fosowl.github.io/agenticSeek.htmlAgenticSeek官网入口网址2:http://agenticseek.tech/AgenticSeek官网开源项目地址:https://github.com/Fosowl/agenticSeekAgenticSeek中文介绍地址:链接 AgenticSeek 是一款革命性的本地 AI 助手,旨在为用户提供隐私保护和本地化运行的 AI 体验。它基于 DeepSeek R1 模型,支持多种功能,如网页浏览、代码生成、任务规划、语音交互等,所有数据处理均在本地完成,确保用户隐私和数据安全。 AgenticSeek 的核心理念是提供一个完全本地运行的 AI 助手,无需依赖云端服务,用户数据不会被发送到外部服务器。它支持多种功能,包括智能网页浏览、代码编写与调试、任务规划、多代理协作等,适用于开发、研究、办公、教育等多个领域。 为什么选择 AgenticSeek? 完全本地 & 私有 —— 所有内容都在你的电脑上运行,无云端、无数据共享。你的文件、对话和搜索都保持私密。智能网页浏览 —— AgenticSeek 可自主浏览互联网:搜索、阅读、提取信息、填写网页表单,全程免手动。自动化编程助手 —— 需要代码?它能编写、调试并运行 Python、C、Go、Java 等程序,无需监督。智能代理选择 —— 你提问,它自动判断最合适的代理来完成任务。就像有一支专家团队随时待命。规划并执行复杂任务 —— 从旅行规划到复杂项目,可将大任务拆分为步骤,调用多个 AI 代理协作完成。语音支持 —— 干净、快速、未来感的语音与语音转文本功能,让你像科幻电影中的 AI 一样与它对话。(开发中) AgenticSeek 的部署和使用相对简单,用户可以通过安装 Git、Python、Docker 等工具进行本地部署,并通过命令行或 Web 界面进行操作。它支持多种编程语言和任务处理能力,适合需要隐私保护和本地化 AI 解决方案的用户。 AgenticSeek 是一个开源项目,其代码托管在 GitHub 上,社区活跃,支持多语言和多平台部署,适合开发者和研究人员使用。 AgenticSeek 是一个功能强大、隐私保护、本地运行的 AI 助手,适合需要隐私保护和本地化 AI 解决方案的用户。

browser-use
browser-use

browser-use是一个开源的AI驱动浏览器自动化框架,旨在实现复杂网页任务的自动化,如购物结账、LinkedIn数据同步等。它是一个开源的AI驱动浏览器自动化工具,支持多种AI模型,如DeepSeek和GPT-4o,用户可以通过自然语言指令让AI执行浏览器自动化任务,如浏览网页、点击链接、提取信息、填写表单、订机票等。该工具支持命令行和Web UI两种版本,兼容多种AI模型,并且可以替代OpenAI的ChatGPT Operator功能。 browser-use官网入口网址:https://browser-use.com/browser-use开源项目地址:https://github.com/browser-use/browser-use browser-use是一个开源的Python库,专为大语言模型设计的智能浏览器工具,旨在让AI能像人类一样自然地浏览和操作网页。它支持多标签页管理、视觉识别、内容提取,并能记录和重复执行特定动作。它支持多种大语言模型,如DeepSeek、GPT-4、Claude等,可同时运行多个任务,具备自我修正功能,提高任务执行的准确性和效率。该工具还支持跨平台操作,支持Chrome、Firefox、Safari和Edge等浏览器及Windows、macOS和Linux等操作系统。 browser-use是一个开源的网页自动化库,允许大型语言模型(LLM)与网站进行交互,通过简单的接口实现复杂的网页操作。它支持多种语言模型、智能识别网页元素、多标签管理、XPath数据提取、视觉信息处理及自定义操作。该工具解决了传统网页自动化中的一些痛点,如动态内容处理、长任务解决等。

Xinference
Xinference

Xinference 是一个开源的 AI 模型部署与推理框架,旨在简化大模型的部署、运行与调用流程。它支持多种模型类型,包括大语言模型(LLM)、多模态模型、语音识别模型等,并提供高性能、分布式、跨平台的推理能力。Xinference 提供了多种部署方式,包括本地部署、容器化部署、Docker 部署等,支持多种硬件环境,如 CPU、GPU、Apple M 系列芯片等。 Xinference官网入口网址:https://inference.readthedocs.io/Xinference中文官网网址:https://inference.readthedocs.io/zh-cn/Xinference开源项目地址:https://github.com/xorbitsai/inference Xinference 的核心优势包括多模型支持、灵活量化配置、跨硬件适配、分布式推理、统一 API 接口和自动模型管理。它支持多种推理引擎,如 vLLM、TensorRT、Transformers、vLLM、llama.cpp 等,能够优化推理性能并提升模型推理效率。Xinference 还支持与 LangChain、LlamaIndex、LangChain 等框架的无缝集成,便于构建复杂的 AI 应用。 Xinference 提供了多种部署方式,包括命令行工具、RESTful API、CLI、WebUI 等,用户可以通过命令行或 API 调用模型,支持异步调用和流式处理。Xinference 的安装和使用相对简便,支持通过 pip 安装,也支持通过 Docker Compose 快速部署。 Xinference 是一个开源项目,托管在 GitHub 上,用户可以通过 GitHub、Slack 社区、Twitter 等平台参与项目,提交问题、报告 Bug 或提出功能请求。Xinference 的社区活跃,支持用户交流和贡献代码,持续更新和优化项目。 Xinference 是一个功能强大、灵活且易于使用的 AI 模型部署与推理框架,适用于企业级和研究级的 AI 应用开发。

PaddleSpeech
PaddleSpeech

PaddleSpeech 是一个基于 PaddlePaddle 平台的开源工具包,专注于语音和音频领域的多种关键任务。它支持语音识别、语音翻译、文本到语音合成等功能,并且提供了多种模型和数据集,如 LibriSpeech、LJSpeech 等 。PaddleSpeech 提供了易用、高性能和灵活的实现,支持训练、推断、测试和部署 。它还支持多种语言处理任务,如中文前端处理、语音到文本、文本到语音等 。 PaddleSpeech官网入口网址:https://paddlespeech.readthedocs.io/PaddleSpeech开源项目地址:https://github.com/PaddlePaddle/PaddleSpeechPaddleSpeech中文介绍:链接 PaddleSpeech 是百度飞桨开发的语音工具,支持通过自监督学习(Speech SSL)在大规模无标签语音数据集上训练模型,生成良好的声学表示,并可用于其他语音任务的微调 。PaddleSpeech 提供了简便的方式调用语音服务,通过一行命令即可启动和调用服务 。 PaddleSpeech 的安装和使用可以通过多种方式完成,包括使用 pip 安装、Docker 安装等 。用户可以通过命令行或 Python API 一键体验语音识别、合成、分类等功能 。PaddleSpeech 提供了详细的教程文档、模型列表和相关论文,方便用户学习和使用 。 PaddleSpeech 在多个方面展示了其强大的功能和应用,包括语音合成、语音识别、音频分类、声纹识别等任务 。它不仅支持中文语音合成和识别,还支持多种语言处理任务,如中文前端处理、语音到文本、文本到语音等。

MultiTalk
MultiTalk

Multitalk 是一个由多个人物驱动的音频驱动多人物对话视频生成系统。它能够根据音频输入、参考图像和提示生成包含互动、对话、唱歌和卡通角色的视频内容。该系统支持单人或多人物生成、交互式虚拟人物控制、卡通角色生成、分辨率灵活性(480p 和 720p)以及长达 15 秒的视频生成。 MultiTalk官网入口网址:https://meigen-ai.github.io/multi-talk/MultiTalk开源项目地址:https://github.com/MeiGen-AI/MultiTalk   Multitalk 的核心创新在于其音频驱动的多人物对话视频生成框架,能够根据多路音频输入、参考图像和提示生成符合音频内容的唇部动作和互动视频。该系统支持多种优化技术,如 INT8 量化、SageAttention、TeaCache 加速、多 GPU 推理、低 VRAM 推理等,以提升性能和效率。 Multitalk 的开发团队由多位研究人员组成,包括 Zhe Kong、Feng Gao、Yong Zhang 等,他们在人工智能、计算机视觉和多媒体生成领域具有深厚的专业背景。该项目已发布在 Hugging Face、GitHub 和 Replicate 平台,并提供了详细的模型下载、推理代码和使用示例。 Multitalk 的目标是推动多人物对话视频生成技术的发展,为虚拟人物、娱乐、教育和内容创作等领域提供强大的技术支持。其开源模型和工具的开放性,也为研究者和开发者提供了丰富的资源和灵活性。 Multitalk 的官方网站和项目页面提供了详细的文档、模型下载、使用指南和社区支持,是研究和应用该技术的重要资源。

PPTist
PPTist

PPTist 是一个基于 Web 的演示文稿(幻灯片)应用,旨在提供类似 Microsoft PowerPoint 的功能,支持文本、图片、形状、图表、表格、视频、音频、公式等元素的编辑和展示。它支持在浏览器中直接编辑和演示幻灯片。 PPTist官网入口网址:https://pipipi-pikachu.github.io/PPTist/PPTist开源项目地址:https://github.com/pipipi-pikachu/PPTistPPTist中文介绍:链接常见问题:链接 主要特点: 技术栈:基于 Vue 3.x 和 TypeScript,不依赖 UI 组件库,便于自定义和扩展。用户友好:提供上下文菜单、快捷键、编辑细节优化,力求提供桌面应用般的体验。功能丰富:支持 AI 生成 PPT、多种导出格式(PPTX、JSON、PDF)、移动端支持、历史记录、撤销/重做、快捷键、右键菜单、AI 功能等。目标用户:适合有 Web 开发经验的开发者,而非普通用户或低代码平台用户。开源协议:采用 AGPL-3.0 开源协议,允许商业使用但需遵守开源协议,商业使用需联系作者获取独立授权。 使用方式: 可通过 GitHub 仓库克隆项目并运行本地开发服务器。提供在线演示地址:https://pipipi-pikachu.github.io/PPTist/提供详细的文档和开发指南,包括项目结构、开发文档、FAQ 等。 项目定位: 不是低代码平台、H5 编辑器、图像编辑器或白板应用。适合开发者用于 Web 演示文稿开发,而非普通用户使用。 PPTist 是一个功能丰富、技术先进的 Web 演示文稿工具,适合有 Web 开发经验的开发者使用。它提供了丰富的功能和良好的扩展性,但并非面向普通用户的“即用型”工具。其开源协议(AGPL-3.0)对商业使用有特定要求,需遵守开源协议或联系作者获取商业授权。

1 2 3 4