OpenMusic – 基于 QA-MDT 的开源高质量文生音乐模型
OpenMusic是什么 OpenMusic 是一款基于 QA-MDT(Quality-aware Masked Diffusion Transformer)技术的高质量…
小米全新 AI 战略:构建未来的智能基础设施,重塑行业格局!
在智能科技日益发展的今天,小米公司正积极调整其战略布局,以适应 AI 大模型的崛起。小米最近宣布将小爱同学的技术团队进行重组,目的是将 AI 技术深度融入到公司各个业务中…
Explorer – AI 3D世界生成模型,文本图像秒变3D渲染场景
Explorer是什么 Explorer是Odyssey公司推出的生成性世界模型,能将任何图像转化为详细的3D世界。Explorer模型擅长生成真实感世界,支持动态效果的…
Phi-3.5 – 微软推出的新一代AI模型,mini、MoE混合和视觉模型
Phi-3.5是什么 Phi-3.5是微软推出的新一代AI模型系列,包含 Phi-3.5-mini-instruct、Phi-3.5-MoE-instruct 和 Phi…
OutofFocus – 文本驱动图像生成或编辑的AI工具
OutofFocus是什么 OutofFocus是一个基于AI技术的图像编辑工具,基于Gradio平台为用户提供一个直观的界面操作和编辑图片。工具的核心功能是接受用户的文…
AI Youtube Shorts Generator – 开源的AI视频编辑工具,自动分析视频提取精彩片段
AI Youtube Shorts Generator是什么 AI Youtube Shorts Generator 是一款开源的 AI 视频编辑工具,基于 GPT-4、…
SWE-agent – 普林斯顿开源的AI程序员智能体
SWE-agent是什么 SWE-agent是一个由普林斯顿大学NLP组研究人员开发的开源AI程序员和软件工程师系统,利用大型语言模型(如GPT-4)的能力,可以自动解决…
Omages – 开源的3D模型生成项目
Omages是什么 Omages是一个开源的3D模型生成项目,基于图像扩散技术将3D形状的几何和纹理信息编码进64×64像素的2D图像中,简化3D建模流程。不仅提高了3D…
Loopy – 字节跳动推出的音频驱动的AI视频生成模型
Loopy是什么 Loopy是字节跳动推出的音频驱动的AI视频生成模型,用户可以让一张静态照片动起来,照片中的人物根据给定的音频文件进行面部表情和头部动作的同步,生成逼真…
FreeAskInternet – 免费开源的本地AI搜索引擎
FreeAskInternet是什么 FreeAskInternet是一个免费开源的本地AI搜索引擎,整合了GPT-3.5等先进的大型语言模型(LLM)和SearXNG元…
ConsiStory – 免训练实现主题一致性的文生图方法
ConsiStory是什么 ConsiStory是由NVIDIA和特拉维夫大学的研究人员共同开发的一种无需训练的文本生成图像的方法,可以实现让图像在保持风格和主题不变的情…
港股AI板块热度不减:智谱、MiniMax解禁日表现抢眼
在港股人工智能板块近期持续走强的背景下,两家行业标杆企业——智谱与MiniMax,在7月9日这一天成为了市场关注的焦点。尽管面临着解禁压力,但这两家公司不仅顶住了震荡,股…
SFR-RAG – 专注于上下文理解和检索增强生成的语言模型
SFR-RAG是什么 SFR-RAG是由Salesforce AI Research推出的一款大型语言模型,专注于提升机器在理解和生成文本方面的应用能力。模型特别强调对上…
Prime Intellect完成1. 3 亿美元融资,估值达 10 亿美元
近日,专注于提供计算资源与开发工具的初创公司Prime Intellect宣布完成1. 3 亿美元的A轮融资,公司估值一举跨入 10 亿美元独角兽行列。本轮融资阵容豪华,…
Gemini 2.0 Flash Thinking – 谷歌推出的最新推理模型,支持百万上下文展示思考路径
Gemini 2.0 Flash Thinking是什么 Gemini 2.0 Flash Thinking 是谷歌最新发布的推理增强型 AI 模型,专为复杂问题的高效推…
Seed-ASR – 字节跳动推出的AI语音识别模型
Seed-ASR是什么 Seed-ASR是字节跳动推出的一款基于大型语言模型(LLM)的语音识别(ASR)模型。在超过2000万小时的语音数据和近90万小时的配对ASR数…
