Windows‑Use 是 CursorTouch 团队在 2025 年推出的开源 Windows 自动化代理 项目,旨在让大型语言模型(LLM)直接操控 Windows 操作系统,实现系统级别的自动化任务。
Windows‑Use开源项目官网入口网址:
- 核心功能:项目支持 打开应用、按钮点击、文字输入、运行命令 等基本交互,并能够 实时捕获和理解界面状态,智能判断下一步操作。它不依赖传统的计算机视觉模型,而是通过直接读取 UI 树信息实现高效交互。
- 兼容性:兼容 Windows 7 至 Windows 11 各版本,且提供 语音输入 接口,进一步降低使用门槛。
- 使用场景:除了日常办公自动化外,项目还可用于 游戏脚本、软件测试、批量任务执行 等多种场景,展示了 AI 与桌面环境深度融合的潜力。
- 安全提示:由于 Windows‑Use 直接操作系统资源,项目方建议 在沙盒或受控环境中使用,以降低误操作或安全风险。
Windows‑Use 为 AI 与本地桌面交互提供了一条全新的路径,使得 LLM 能像“系统管理员”一样执行复杂的 UI 操作,极大提升了生产力和自动化水平。
数据统计
相关导航
Deep-Research 是由 GitHub 用户 dzhng 开发的一款开源 AI 研究助手,旨在通过结合搜索引擎、网络爬取和大型语言模型(LLM),实现对任意主题的迭代、深入研究。该项目以轻量化设计(代码行数少于 500 行)为目标,提供简单易懂的深度研究代理实现,使其易于理解、扩展和定制。 deep-research开源项目官网入口网址:https://github.com/dzhng/deep-research Deep-Research 的核心功能包括: 智能研究导航:基于用户输入的研究目标,动态生成和优化搜索关键词,并通过广度和深度参数(广度 3-10,深度 1-5)控制研究范围和层级。多源信息融合:支持通过 Firecrawl API 精准提取网页内容,同时允许用户自建爬虫实例,实现对网络数据的高效抓取。认知迭代引擎:通过多轮迭代研究,代理能够根据研究进展不断调整方向,深入挖掘信息。报告智能生成:自动生成结构化的 Markdown 报告,包含关键发现、溯源链接及详细分析。多模型支持:兼容多种大型语言模型,如 OpenAI GPT 系列、DeepSeek R1 等,用户可根据需求选择适合的模型。 Deep-Research 的应用场景广泛,包括学术文献综述、市场分析、技术预研和医学证据溯源等。通过其智能化的功能,用户可以高效完成复杂课题的研究任务。项目支持本地部署和 Docker 容器化运行,提供灵活的安装和配置方式。 Deep-Research 正在成为知识获取和研究分析领域的热门工具,其开源特性使其成为学术界和工业界深度研究的智能利器。
EdgeClaw 是由面壁智能联合清华大学自然语言处理实验室(THUNLP)、中国人民大学、AI9Stars 以及 OpenBMB 社区共同研发的开源人工智能智能体运行框架。它定位为“安全高效的端云协同计算平台”,旨在解决当前 AI 应用在数据隐私泄露、成本失控以及对云端算力过度依赖等痛点。 EdgeClaw开源项目官网网址:https://github.com/OpenBMB/EdgeClawEdgeClaw中文介绍地址:链接 EdgeClaw 核心特性、技术架构和应用场景的详细解析: 1. 核心理念:安全与隐私至上 EdgeClaw 的诞生背景是为了解决 OpenClaw 在实际落地中出现的“隐私泄露”和“Token 浪费”问题。它通过引入三级安全协同机制,将用户数据按敏感程度分为 S1、S2、S3 三级进行处理: S1 级(公开数据):可以直接发送至云端模型处理。S2 级(敏感数据):在发送至云端之前会进行脱敏处理,确保隐私信息不外泄。S3 级(核心机密):绝对不出门,必须由本地模型离线运行处理,零 Token 消耗。 这种“分级治理”结合 GuardAgent 隐私中间件和双检测引擎,构建了全链路的自动安全系统,确保数据在传输、处理和存储过程中的安全性。 2. 端云协同:成本与效率的平衡 EdgeClaw 通过性价比感知协同机制,实现了本地模型与云端模型的智能调度。 本地处理:对于计算量小、对延迟敏感或涉及机密信息的任务(如个人助理、内部文档处理),EdgeClaw 会自动路由至本地部署的 MiniCPM 系列模型或其他轻量模型进行处理。云端计算:对于计算量大、需要强大算力的任务(如复杂的内容生成、深度分析),则调用云端大模型。 这种双轨机制不仅保护了隐私,还显著降低了运营成本,因为本地处理的任务不消耗昂贵的云端 Token。 3. 强大的多智能体框架 EdgeClaw 继承了 OpenClaw 的“入口层、调度层、执行层”的设计,并在此基础上强化了安全性。它支持: 多设备部署:支持在 DGX Spark、Mac Mini、松果派等多种硬件设备上运行。多模型协同:不仅支持本地模型(如 MiniCPM),还支持与云端模型的无缝协作。海量 Skills 生态:内置了 54 个 AI 能力(Skills),覆盖通用办公(如邮件分类、简报生成)和专业垂直领域(如审计质检、财务顾问)。4. 硬件落地:EdgeClaw Box 为了让技术更加落地易用,面壁智能推出了硬件产品 EdgeClaw Box。这是一款软硬一体化的 AI 操作系统,预装 EdgeClaw 框架和 MiniCPM 模型,支持开箱即用。用户无需复杂配置,即可体验到“本地跑小龙虾”的安全感和高效性。 5. 开源精神与社区 EdgeClaw 坚持开源原则,所有代码和文档均公开,用户可以在代码层面审视每一个动作,随时修改或定制。这不仅保障了技术的透明度,也鼓励了全球开发者共同参与到智能体生态的建设中。 EdgeClaw 并不是单纯的 AI 软件,它是面向“一人公司”(OPC)和数据敏感型企业的全新 AI 解决方案。它打破了传统 AI 必须依赖云端的思维定式,让用户掌握了数据和算力的主动权,真正实现了“安全可控、成本降低、效率提升”的目标。
DeepTutor 是由香港大学数据智能实验室(HKU Data Intelligence Lab)开发的一款开源、AI 驱动的个性化学习助手,旨在通过多智能体系统与先进检索增强生成(RAG)技术,为用户提供深度、交互式、个性化的学习体验。 DeepTutor官网入口网址:https://hkuds.github.io/DeepTutor/DeepTutor开源项目地址:https://github.com/HKUDS/DeepTutor 其核心功能涵盖四大模块:大规模文档知识问答、交互式学习可视化、知识强化练习生成以及深度研究与创意生成。 用户可上传教材、论文或技术手册构建专属知识库,系统基于双循环推理架构(分析环 + 解答环)进行多步推理,并结合 RAG、网络搜索与代码执行工具,提供带精确引用的答案。 同时,DeepTutor 能将复杂概念转化为可视化 HTML 页面,支持上下文感知的智能问答,并根据学习进度自动生成定制化习题——甚至可模仿真实考卷风格出题。 在科研方面,其“深度研究”模块采用动态主题队列与三阶段流程(规划→研究→报告),自动开展跨源文献综述并输出结构化报告;“创意生成”模块则能从笔记中提炼知识点,激发创新研究思路。 系统采用前后端分离架构(FastAPI + Next.js),支持 CLI 与 Web 界面,所有学习记录与成果均持久化存储于本地,保障隐私与可控性。项目遵循 AGPL-3.0 开源协议,适合教育、科研及自主学习场景。
Diffutoon 是一种由阿里巴巴达摩院与华东师范大学联合研发的先进动漫风格渲染技术,旨在将真实视频转换为逼真的动漫风格。该技术基于扩散模型(Diffusion Model),通过学习大量图片数据生成新的图像和视频,从而实现高分辨率、高一致性和可编辑的卡通着色效果。 Diffutoon官网入口网址:https://ecnu-cilab.github.io/DiffutoonProjectPage/ Diffutoon开源项目地址:https://github.com/modelscope/DiffSynth-Studio Diffutoon 的核心优势在于其能够处理高分辨率和快速运动的视频,同时保持内容的一致性和视觉吸引力。其技术流程包括风格化、一致性增强、结构指导和着色四个关键子问题的解决。通过多模块去噪模型、控制网络、动画滑动扩散、快速注意力机制等技术手段,Diffutoon 能够生成高质量的动漫风格视频。 Diffutoon 的主要功能包括: 高分辨率输出:支持高达 1536 x 1536 的分辨率,适用于高分辨率和快速运动的视频。内容一致性:通过控制网络和动画滑动扩散技术,确保视频帧间的一致性和连贯性。智能编辑:用户可以通过编辑分支根据提示生成彩色视频信号,实现个性化内容创作。自动着色:根据视频内容和风格要求自动选择合适的颜色填充,确保颜色协调性和视觉吸引力。超分辨率与上色:即使输入视频分辨率较低,也能生成高质量的动漫风格视频。 Diffutoon 的应用场景广泛,包括动画制作、视频游戏开发、电影后期制作、虚拟现实和增强现实、社交媒体内容创作、广告和营销、教育和培训等领域。此外,Diffutoon 的代码和模型已开源,用户可以通过 GitHub 平台访问并体验其功能。 Diffutoon 是一项革命性的视频转绘技术,为创作者提供了强大的工具,使他们能够轻松将真实视频转化为具有动漫风格的高质量作品。其开源特性进一步推动了技术的普及和发展,为数字创意领域带来了无限可能。
AutoResearchClaw 是一款革命性的开源框架,它实现了从单一研究想法到完整学术论文的端到端全自动研究闭环。该项目深度集成于OpenClaw生态系统,旨在彻底消除科研过程中的人工重复劳动,让研究人员能够更专注于核心思想的碰撞,而非琐碎的格式调整与实验执行。 AutoResearchClaw开源项目官网入口网址:https://github.com/aiming-lab/AutoResearchClaw 核心能力:一句指令,交付论文 该项目的最大魅力在于其极简的交互方式。用户只需向系统输入一个核心研究指令或课题,剩下的复杂工作流程将完全自动化。具体而言,系统能够根据用户提供的想法,自动完成从文献搜集、实验设计、代码编写与执行,到最终生成符合顶级会议(如NeurIPS、ICLR)LaTeX模板的论文初稿的全过程。运行结束后,它会交付一个包含所有实验数据、代码和文档的完整成果包。 技术架构:多智能体协作与自我进化 AutoResearchClaw的强大能力源于其精密的工程化设计。它将AI研究员的工作流拆解为8大阶段、23个子阶段,并通过多智能体协作与工具调用的方式实现每个环节的自动化。其技术核心包括: JINA驱动的语义检索与文献验证:系统利用RAG架构,从Arxiv等学术数据库进行多维语义检索,并通过学术引用图谱自动验证文献真实性,有效防御AI幻觉生成的虚假引用,确保学术严谨性。多智能体辩论与决策机制:在关键阶段(如假设生成、结果分析),系统会启动多个具备不同视角的虚拟智能体进行结构化辩论。例如,一个智能体负责疯狂输出创意,另一个则排查本地GPU算力,还有一个专门挑刺找漏洞。通过这种模拟同行评审的博弈,强制提升研究质量。自我修复与进化的流水线:系统具备“PIVOT/REFINE”决策循环。实验阶段会根据结果自动评估假设,决定是继续推进、优化参数还是彻底推翻重来。更重要的是,它能从每次运行中提取细粒度教训并持久化存储,通过时间衰减加权的方式注入未来的研究任务中,使流水线具备从错误中学习的能力。全面的质量监控(Sentinel看门狗):后台监控模块会捕获主流水线可能遗漏的问题,如检测实验指标中的异常值、确保论文声称的实验次数与实际代码运行次数一致、评估引用的相关性等,从多个维度守卫研究质量。部署与使用 AutoResearchClaw设计为OpenClaw兼容服务。对于OpenClaw用户,只需将项目地址分享给OpenClaw,它便能自动理解并部署整个流水线,用户通过一句“帮我研究[你的主题]”即可启动。同时,它也支持通过命令行(CLI)独立使用。 AutoResearchClaw不仅仅是一个工具,更是一个“物理意义上零人工干预”的自动化研究基础设施。它通过硬核的工程化设计,将前沿的AI能力转化为稳定、可复现的学术生产力,代表了AI驱动科研的未来方向,有望为研究人员节省成百上千小时的人工成本。
GPT-SoVITS 是一个基于文本到语音(TTS)和语音转换(VC)技术的开源项目,旨在实现高质量的语音合成与转换。该项目支持多种语言,包括英语、日语、韩语、粤语和中文,并且具备零样本(Zero-shot)和少量样本(Few-shot)训练能力,能够快速适应不同说话人和语言环境。 GPT-SoVITS开源项目官网地址:https://github.com/RVC-Boss/GPT-SoVITSGPT-SoVITS中文介绍:链接GPT-SoVITS指南:https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1eGPT-SoVITS视频介绍:链接 GPT-SoVITS 提供了丰富的功能,包括即时文本到语音转换、语音分离与增强、自动训练集分割、ASR(自动语音识别)和文本标注工具,帮助用户轻松创建训练数据集和模型。用户可以通过 WebUI 界面进行模型训练、推理和模型优化,支持多种设备和平台,包括 Windows、Linux 和 Docker 容器部署。 在性能方面,GPT-SoVITS 在推理速度上表现出色,尤其在高性能 GPU 上运行速度更快,适合大规模应用。此外,项目还提供了详细的安装指南、模型下载链接和社区支持,方便用户快速上手和使用。 GPT-SoVITS 是一个功能强大、灵活且易于使用的语音合成与转换工具,适合研究人员、开发者和语音技术爱好者使用。
