服务粉丝

我们一直在努力
当前位置:首页 > 财经 >

微软必应再强化!接入OpenAI DALL·E模型,文字生成图像

日期: 来源:机器之心收集编辑:

机器之心报道

机器之心编辑部

微软必应完善文字生成图像能力,Adobe 今日也发布 Firefly,杀入生成式 AI 这场游戏。


今晚实在是有些热闹。


一边英伟达 GTC 正在进行中,一边谷歌正式开放了 Bard 的测试,这里微软必应也不甘寂寞。



今日,微软正式宣布,必应搜索引擎接入了 OpenAI 的 DALL·E 模型,增加了 AI 生成图像的功能。


也就是说,在接入 ChatGPT 之后,必应再次强化,Bing Image Creator 能够让用户用 DALL·E 模型生成图像。


「对于拥有必应预览版权限的用户,Bing Image Creator 将完全集成到必应聊天体验中,首先在创意模式下推出。」微软消费者营销主管 Yusuf Mehdi 解释道。「通过输入图像描述,提供位置或活动等额外语境,选择艺术风格,Image Creator 将根据用户的想象生成图像。」



必应具有三种响应模式:创意模式、平衡(balanced)模式和精确(precise)模式。创意模式下必应生成的结果通常是「原创和富有想象力的」,而精确模式则倾向于准确性和相关性,以获得更真实和简洁的答案。目前 Image Creator 只能在创意模式下使用。


值得一提的是,即使没有必应预览版的使用权限,用户也可以通过直接访问 bing.com/create 单独使用 Image Creator 来尝试其图像生成功能,目前仅支持英文输入。微软表示,随着时间的推移,它将支持更多的语言输入。


此外,微软今天还在必应中推出了新的 AI 支持的视觉故事(visual Stories)和 Knowledge Cards 2.0。



我们简单为大家梳理介绍下 OpenAI 文本生成图像的 DALL·E 系列研究。


2021 年 1 月 6 日,OpenAI 博客发布了两个连接文本与图像的神经网络:DALL・E 和 CLIP。DALL・E 可以基于文本直接生成图像,CLIP 则能够完成图像与文本类别的匹配。这两项研究的发布,引起了社区极大的关注。


据博客介绍,DALL・E 可以将以自然语言形式表达的大量概念转换为恰当的图像,可以说是 GPT-3 的 120 亿参数版本,可基于文本描述生成图像。


DALL・E 示例。给出一句话「牛油果形状的椅子」,就可以获得绿油油、形态各异的牛油果椅子图像。


2 个月后,DALL·E 的论文和代码公开。



  • 项目地址:https://github.com/openai/DALL-E

  • 论文地址:https://arxiv.org/abs/2102.12092


2022 年 4 月 7 日左右,DALL・E 迎来了升级版本 ——DALL・E 2。与 DALL・E 相比,DALL・E 2 在生成用户描述的图像时具有更高的分辨率和更低的延迟。并且,新版本还增添了一些新的功能,比如对原始图像进行编辑。


OpenAI 还公布了 DALL・E 2 的研究论文《Hierarchical Text-Conditional Image Generation with CLIP Latents》。



论文地址:https://cdn.openai.com/papers/dall-e-2.pdf


此次必应接入的 DALL・E 应该是经过更新迭代的。这在一定程度上,弥补了当前 ChatGPT 在跨模态生成方面缺失的体验。不过等到 GPT-4 多模态能力开放后,也许能为我们带来更多新的体验。


最后提一句,今日还有一项生成式 AI 的发布引起了业内人士的关注与讨论。

那就是 Adobe 发布 Firefly。这是一系列用于创意表达的生成式 AI 模型,让用户可以通过键入命令快速修改图像。目前,Firefly 开放了测试版本,感兴趣的读者可以申请体验。


如今看来,生成式 AI 这场游戏有越来越多的玩家涌入,竞争也变得越来越激烈。


参考链接:

https://blogs.microsoft.com/?p=52560769

https://www.theverge.com/2023/3/21/23649943/microsoft-bing-openai-dall-e-image-creator-ai


探寻隐私计算最新行业技术,「首届隐语开源社区开放日」报名启程


春暖花开之际,诚邀广大技术开发者&产业用户相聚活动现场,体验数智时代的隐私计算生态建设之旅,一站构建隐私计算产业体系知识:

  • 隐私计算领域焦点之性

  • 分布式计算系统的短板与升级策略

  • 隐私计算跨平台互联互通

  • 隐语开源框架金融行业实战经验

3月29日,北京·798机遇空间,隐语开源社区开放日,期待线下面基。

点击阅读原文,立即报名。

© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:content@jiqizhixin.com

相关阅读

  • 申花之后,市中心还有什么红盘能摇?

  • NO. 1|壹800多套的“申花之眼”馥香园,搅动起连场社保巨子局,3个月即清盘。无数落选者在惆怅中发问:市中心还有什么红盘能摇?申花大户型或已不可追,但市中心的成功路径,却殊途同归

热门文章

  • “复活”半年后 京东拍拍二手杀入公益事业

  • 京东拍拍二手“复活”半年后,杀入公益事业,试图让企业捐的赠品、家庭闲置品变成实实在在的“爱心”。 把“闲置品”变爱心 6月12日,“益心一益·守护梦想每一步”2018年四

最新文章

  • 谷歌版ChatGPT Bard开放测试!我们已经体验上了

  • 机器之心报道机器之心编辑部机器之心已经体验上了Bard。在 OpenAI GPT-4 发布、微软将 GPT-4 接入 Office 全家桶这样一波碾压后,谷歌也有了新的动作!刚刚,谷歌宣布正式公开发
  • 英伟达发布ChatGPT专用GPU,推理速度提升了10倍

  • 机器之心报道编辑:泽南、蛋酱AI 的 iPhone 时刻,要有一块好的芯片。曾何几时,人工智能因为算力不足进入了长达数十年的瓶颈,GPU 点燃了深度学习。在 ChatGPT 时代,AI 因为大模型
  • 贾扬清回应:确认离职,开启新的职业生涯

  • 机器之心报道机器之心编辑部贾扬清从阿里巴巴正式毕业,计划走向职业生涯的下一个挑战。近段时间,ChatGPT 与大模型的爆火,又吸引了整个科技领域以及投资圈对 AI 的关注。最近也