Transformer Debugger – OpenAI开源的理解和分析大模型内部的工具
# 如果已在虚拟环境,先取消激活 deactivate # 创建新的虚拟环境 python -m venv ~/.virtualenvs/transformer-debu…
DistriFusion – 高分辨率扩散模型的分布式并行推理框架
DistriFusion是什么 DistriFusion是高分辨率扩散模型的分布式并行推理框架,通过分布式并行推理显著加速了扩散模型在多个GPU上生成高分辨率图像的过程。…
STranslate – 多功能免费AI翻译工具,支持离线OCR识别
STranslate是什么 STranslate是专为Windows用户设计的多功能翻译和OCR工具。支持多种语言翻译,具备划词、截图、监听剪贴板等多种翻译方式,并提供多…
Universal-1 – AssemblyAI推出的多语种语音识别和转换模型
Universal-1是什么 Universal-1是AI语音初创公司AssemblyAI推出的一款多语言语音识别和转录模型,经过超过1250万小时的多语种音频数据训练,…
DemoFusion – 免费开源的图像分辨率超清增强框架
DemoFusion是什么 DemoFusion是一个旨在低成本进行高分辨率图像生成的技术框架,通过扩展现有的开源生成人工智能模型(如Stable Diffusion),…
Manga Image Translator – 开源漫画图片文字翻译工具,多语言翻译无缝嵌入原图
Manga Image Translator是什么 Manga Image Translator是开源的漫画图片文字翻译工具,能一键翻译漫画和图片中的文字。Manga I…
Buzz – 免费开源的AI语音转文字工具
Buzz是什么 Buzz是一款基于OpenAI Whisper模型构建的离线语音转文字工具,适用于Windows、macOS和Linux系统。Buzz能将麦克风输入或音频…
Pix2Gif – 微软推出的静态图像转动态GIF的扩散模型
Pix2Gif是什么 Pix2Gif是由微软研究院的研究人员提出的一个基于运动引导的扩散模型,专门用于将静态图像转换成动态的GIF动画/视频。该模型通过运动引导的扩散过程…
Still-Moving – DeepMind推出的AI视频生成框架
Still-Moving是什么 Still-Moving是DeepMind推出的AI视频生成框架,支持用户定制文本到视频(T2V)模型,无需特定视频数据。通过训练轻量级的…
LTM-2-mini – Magic公司推出的支持1亿token上下文AI模型
LTM-2-mini是什么 LTM-2-mini是Magic公司推出的支持1亿token上下文AI模型,能处理相当于1000万行代码或750本小说的内容。LTM-2-mi…
Codestral – Mistral AI推出的代码生成模型,支持80+编程语言
Codestral是什么 Codestral是法国人工智能初创公司Mistral AI推出的一款代码生成AI模型,专为提高软件开发效率而设计,支持超过80种编程语言,包括…
ActAnywhere – Adobe推出的AI视频背景生成模型
ActAnywhere是什么 ActAnywhere是一个由斯坦福大学和Adobe Research的研究人员共同开发的视频生成模型,旨在解决视频背景生成的问题,特别是在…
Ivy-VL – AI Safeguard联合卡内基梅隆和斯坦福开源的轻量级多模态模型
Ivy-VL是什么 Ivy-VL是AI Safeguard联合卡内基梅隆大学和斯坦福大学推出的轻量级多模态AI模型,专为移动端和边缘设备设计。模型拥有3B参数量,相较于其…
HoloDreamer – AI文本驱动3D场景生成框架
HoloDreamer是什么 HoloDreamer是北京大学联合鹏城实验室推出的AI文本驱动3D场景生成框架。通过两个核心模块:风格化全景图生成和增强两阶段全景图重建,…
Follow-Your-Click – 腾讯等开源的图像到视频模型,可生成局部动画
Follow-Your-Click是什么 Follow-Your-Click是一个由来自腾讯公司(混元团队)联合清华大学和香港科技大学的研究人员共同研发的图像到视频(Im…
AutoShorts – 开源的AI视频创作和自动发布平台
AutoShorts是什么 AutoShorts是开源的AI视频创作和发布平台,使用AI技术一键生成并定制无脸视频。AutoShorts支持自定义脚本、配音和视觉效果,每…
