StockMixer – 上海交大推出的股票价格预测架构
StockMixer是什么 StockMixer是上海交通大学推出的用在股票价格预测的多层感知器(MLP)架构,具备简单和强大的预测能力。架构基于指标混合、时间混合和股票…
EnerVerse – 智元机器人推出的首个机器人4D世界模型
EnerVerse是什么 EnerVerse 是智元机器人团队开发的首个机器人4D世界模型,通过生成未来具身空间来指导机器人完成复杂任务。模型采用自回归扩散模型,结合稀疏…
Collaborative Gym – 支持人与AI代理实时交互协作的评估框架
Collaborative Gym是什么 Collaborative Gym(Co-Gym)是专注于人机协作(Human-Agent Collaboration)的框架,…
TongGeometry – 北京通院联合北大AI研究院推出的几何模型
TongGeometry是什么 TongGeometry 是北京通用AI研究院和北京大学AI研究所联合推出的基于树搜索的几何模型,专门用在提出和解决奥林匹克级别的几何问题…
OpenManus – MetaGPT 团队推出的 Manus 开源复刻版
conda create -n open_manus python=3.9 # 创建环境,推荐使用 Python 3.9 conda activate open_manu…
VisoMaster – AI换脸和编辑软件,支持图片和视频高质量换脸
VisoMaster是什么 VisoMaster 是基于 AI 技术的换脸和编辑软件,功能强大操作简便。支持图片、视频以及直播换脸,能生成自然逼真的换脸效果,应用于娱乐、…
EMAGE – 清华联合东大等机构推出的音频生成全身共语手势框架
EMAGE是什么 EMAGE(Expressive Masked Audio-conditioned GEsture modeling)是清华大学、东京大学、庆应义塾大学…
ARTalk – 东京大学等机构推出的3D头部动画生成框架
ARTalk是什么 ARTalk是东京大学和日本理化学研究所推出的新型语音驱动3D头部动画生成框架,基于自回归模型实现实时、高同步性的唇部动作和自然的面部表情及头部姿势生…
Qwen2.5-Max – 阿里通义千问推出的MoE模型
Qwen2.5-Max是什么 Qwen2.5-Max是阿里云推出的超大规模MoE(Mixture of Experts)模型,使用超过20万亿tokens的预训练数据。模…
LineArt – 吉林大学等机构推出的设计绘图外观迁移框架
LineArt是什么 LineArt是吉林大学、瑞典皇家理工学院、东京工业大学等机构推出的,无需训练的高质量设计绘图外观迁移框架,能将复杂外观特征转移到详细的设计图纸上,…
Open-LLM-VTuber – AI数字人语音交互项目,支持实时语音对话和视觉感知
Open-LLM-VTuber是什么 Open-LLM-VTuber 是开源的跨平台语音交互 AI 伴侣项目。支持实时语音对话、视觉感知,配备生动的 Live2D 动态形…
星火语音同传大模型 – 科大讯飞推出的端到端语音同传大模型
星火语音同传大模型是什么 星火语音同传大模型是科大讯飞于2025年1月15日发布的国内首个具备端到端语音同传能力的大模型。模型在内容完整度、信息准确度以及语言质量上均处于…
FLUX-Text – 阿里推出的多语言场景文本编辑框架
FLUX-Text是什么 FLUX-Text 是阿里推出的新型的多语言场景文本编辑框架,基于扩散模型(Diffusion Model)和轻量级字形嵌入模块。框架基于注入字…
BFS-Prover – 字节豆包推出的自动定理证明系统
BFS-Prover是什么 BFS-Prover 是字节跳动豆包大模型团队推出的基于大语言模型(LLM)的自动定理证明系统,通过改进传统的广度优先搜索(BFS)算法,结合…
LaDeCo – 西安交大联合微软推出的自动图形设计构图方法
LaDeCo是什么 LaDeCo是西安交通大学和微软研究院联合推出的自动图形设计构图方法,基于将设计任务分解为层次化的步骤来实现。LaDeCo对输入的设计元素进行层规划,…
Seer – 上海 AI Lab 联合北大等机构推出的端到端操作模型
Seer是什么 Seer是由上海AI实验室、北京大学计算机科学与技术学院、北京大学软件与微电子学院等机构联合推出的端到端操作模型,实现机器人视觉预测与动作执行的高度协同。…
