📁 导航集 👤 明峻问道 📅 2025-03-31 DeepFloyd DeepFloyd 是什么: DeepFloyd 是由DeepFloyd Lab在StabilityAI推出的一款先进的开源文本到图像模型。该模型具有高度的逼真度和语言理解能力。它由一个冻结的文本编码器和三个级联像素扩散模块组成:一个基础模型用于生成64×64像素的图像,两个超分辨率模型分别设计用于... 主题分类 #图像生成 #文本到图像 #开源模型 #AI字体设计
📁 导航集 👤 明峻问道 📅 2025-03-31 I2VGen-XL:阿里推出的图生视频模型 I2VGen-XL是什么?I2VGen-XL是阿里巴巴达摩院推出的一款开源的图像到视频的生成模型。它通过创新的级联扩散方法,将文本视频数据与视频结构解耦,同时利用静态图像作为关键指导形式,确保了输入数据的对齐性,将静态图像合成为高质量的动态视频。主要特点:静态图像转视频:用户只需提供静态图像和相应的... 主题分类 #AI开源项目 #开源模型 #文本驱动 #时序连贯性 #真实感
📁 导航集 👤 明峻问道 📅 2025-03-31 Llama 3.2 Llama 3.2是什么:Llama 3.2是Meta公司推出的新一代开源AI大模型系列,包括小型和中型视觉语言模型(11B和90B参数)以及轻量级纯文本模型(1B和3B参数)。这些模型专为边缘设备和移动设备设计,支持128K令牌的上下文长度,并针对高通和联发科硬件进行了优化。Llama... 主题分类 #AI大模型 #AI开源项目 #图像理解 #开源模型 #微调