腾讯混元大模型迎来V1.2升级,加入“文生图”功能,支持6种风格模型绘图

2025-03-31 来源|AI图库吧

AI奇点网10月27日报道丨10月26日,“鹅厂技术派”(腾讯产品技术官方发布账号)发布消息称,腾讯混元大模型近日迎来全新升级,并正式对外开放“文生图”功能。官方宣称,升级后的腾讯混元中文效果整体超过 GPT-3.5,代码能力大幅提升 20%,大模型能力已经达到了业界领先水平。

据介绍,大模型文生图的难点体现在对提示词的语义理解,生成内容的合理性以及生成图片的效果,针对这三个技术难点,腾讯进行了专项的技术研究,提出了一系列原创算法:

在语义理解方面,腾讯混元采用了中英文双语细粒度的模型,模型同时建模中英文实现双语理解,而不是通过翻译,通过优化算法提升了模型对细节的感知能力与生成效果,有效避免多文化差异下的理解错误。

在内容合理性方面,AI 生成人体结构和手部经常容易变形。混元文生图通过增强算法模型的图像二维空间位置感知能力,并将人体骨架和人手结构等先验信息引入到生成过程中,让生成的图像结构更合理,减少错误率。

在画面质感方面,混元文生图基于多模型融合的方法,提升生成质感。经过模型算法的优化之后,混元文生图的人像模型,包含发丝、皱纹等细节的效果提升了 30%,场景模型,包含草木、波纹等细节的效果提升了 25%。

如果用户想生成一张更接近真人感的照片,或接近实拍的图片,可以加上“真实感”或“摄影风”等描述;如果用户想要特定风格的图片,建议在提示词中加入该风格的描述,如油画风、赛博朋克风等。此外,用户还可以对画面进行尽可能详细地描述,以获得满意的效果。

以下为官方发布的更多示例图:

目前,超过180个腾讯内部业务已接入腾讯混元,包括腾讯会议、腾讯文档、企业微信、腾讯广告和微信搜一搜等。任何用户都可以腾讯混元大模型官网或“腾讯混元助手”微信小程序申请内测体验。

最新
更多

腾讯混元大模型迎来V1.2升级,加入“文生图”功能,支持6种风格模型绘图

腾讯混元大模型近日迎来全新升级,并正式对外开放“文生图”功能,腾讯混元中文效果整体超过 GPT-3 5。有超过 180 个内部业务接入混元大模型。

ChatGPT支持P图_DELLE3并入chatgpt

10月29日,有部分用户在社交平台上分享,ChatGPT Plus正在测试原生文件上传、分析功能,可以通过文本问答的方式,对上传的PDF等数据文件进行提问、搜索。

B站灰度测试AI视频总结功能丨智谱AI发布ChatGLM 3大模型丨谷歌向Claude投资20亿美元

【AI奇点网2023年10月30日早报】本站每日播报AI业界最新资讯,触摸时代脉搏,掌握未来科技动向。事不宜迟,点击查看今日AI资讯早餐。

文心一言专业版开启内测:基于文心大模型4.0,每天限量名额,免费体验一个月

10月28日-31日,基于文心大模型4 0的百度文心一言专业版开启邀测活动,进入官网,在右上角可以找到申请链接。每日早上 9 点开始申请。

ChatGPT已支持文件上传分析丨阿里通义千问发布安卓APP版本丨昆仑万维开源天工大模型

【AI奇点网2023年10月31日早报】本站每日播报AI业界最新资讯,触摸时代脉搏,掌握未来科技动向。事不宜迟,点击查看今日AI资讯早餐。

B站发布官方版本的AI视频总结功能:一键生成关键节点时间戳,快速总结长视频的内容梗概

哔哩哔哩(B站)正在官网测试一项 AI 视频总结功能,顾名思义,也就是借助AIGC技术快速总结视频的简介。

网站地图