热门

TwelveLabs

11个月前发布 22 00

TwelveLabs是一个强大的视频智能平台，通过能够看、听、推理的人工智能，发现深度见解，分析、重组和自动化工作流程。它可以看到视频背后的整个故事，是视频智能的未来。

收录时间：

2025-06-02

打开网站手机查看

视频创作 # 人工智能 # 大数据 # 食品

TwelveLabs

TwelveLabs

TwelveLabs是一个强大的视频智能平台，通过能够看、听、推理的人工智能，发现深度见解，分析、重组和自动化工作流程。它可以看到视频背后的整个故事，是视频智能的未来。

数据统计

相关导航

Wan2.2 AI

Wan 2.2 AI视频生成器是一款免费工具，利用先进的AI技术可以将文本转换为令人惊叹的视频、将照片转换为动画，并生成原创音乐。它的主要优点是无需软件即可使用，提供影院级视频质量，适用于各种场景。

SoraVids

SoraVids是一个基于Hugging Face平台的视频生成模型Sora的存档库。它包含了87个视频和83个对应的提示，这些视频和提示在OpenAI撤销API密钥前被公开展示。这些视频均为MIME类型video/mp4，帧率为30 FPS。SoraVids的背景是OpenAI的视频生成技术，它允许用户通过文本提示生成视频内容。这个存档库的重要性在于它保存了在API密钥被撤销前生成的视频，为研究和教育提供了宝贵的资源。

Sieve Eye Contact Correction

Sieve Eye Contact Correction API 是一个为开发者设计的快速且高质量的视频眼神校正API。该技术通过重定向眼神，确保视频中的人物即使没有直接看向摄像头，也能模拟出与摄像头进行眼神交流的效果。它支持多种自定义选项来微调眼神重定向，保留了原始的眨眼和头部动作，并通过随机的“看向别处”功能来避免眼神呆板。此外，还提供了分屏视图和可视化选项，以便于调试和分析。该API主要面向视频制作者、在线教育提供者和任何需要提升视频交流质量的用户。定价为每分钟视频0.10美元。

genmoai

genmoai/models 是一个开源的视频生成模型，代表了视频生成技术的最新进展。该模型名为 Mochi 1，是一个基于 Asymmetric Diffusion Transformer (AsymmDiT) 架构的10亿参数扩散模型，从零开始训练，是迄今为止公开发布的最大的视频生成模型。它具有高保真运动和强提示遵循性，显著缩小了封闭和开放视频生成系统之间的差距。该模型在 Apache 2.0 许可下发布，用户可以在 Genmo 的 playground 上免费试用此模型。

Runway Aleph AI

Aleph AI是建立在Runway Aleph上的AI视频编辑平台，通过直观的自然语言命令，实现对象编辑、场景角度变化和风格及灯光调整，为用户提供前所未有的创意控制力。价格方面，允许商业使用并提供即时处理，消除了创意愿景与最终输出之间的障碍。

Video Prediction Policy

Video Prediction Policy（VPP）是一种基于视频扩散模型（VDMs）的机器人策略，能够准确预测未来的图像序列，展现出对物理动力学的良好理解。VPP利用VDMs中的视觉表示来反映物理世界的演变，这种表示被称为预测性视觉表示。通过结合多样化的人类或机器人操控数据集，并采用统一的视频生成训练目标，VPP在两个模拟环境和两个真实世界基准测试中均优于现有方法。特别是在Calvin ABC-D基准测试中，相较于先前的最佳技术，VPP实现了28.1%的相对改进，并在复杂的真实世界灵巧手操控任务中提高了28.8%的成功率。

Veo3 JSON Prompt

Veo3 JSON Prompt是一款专业的AI视频生成工具，通过JSON提示库和智能提示生成器，可生成令人惊叹的视频。该产品具有高品质视频生成、多样化风格、精准控制等特点，广泛应用于视频创作领域。

MM_StoryAgent

MM_StoryAgent 是一个基于多智能体范式的故事视频生成框架，它结合了文本、图像和音频等多种模态，通过多阶段流程生成高质量的故事视频。该框架的核心优势在于其可定制性，用户可以自定义专家工具以提升每个组件的生成质量。此外，它还提供了故事主题列表和评估标准，便于进一步的故事创作和评估。MM_StoryAgent 主要面向需要高效生成故事视频的创作者和企业，其开源特性使得用户可以根据自身需求进行扩展和优化。

暂无评论

您必须登录才能参与评论！

none

暂无评论...