文章来源:放心AI网发布时间:2025-03-28 14:11:26
在科技界的最新动态中,OpenAI 刚刚宣布,他们在最新的 GPT-4o 模型中集成了迄今为止最先进的图像生成器。OpenAI 的首席执行官萨姆・奥特曼(Sam Altman)在社交媒体平台 X 上兴奋地分享了他第一次看到模型生成的图像时的震惊,认为这简直难以置信,并期待用户们充分发挥他们的创造力。
新功能的亮点包括:
– 能够精确渲染文本内容,提供高质量的图像效果。
– 支持多种输入输出方式,涵盖文本、图像和音频等多种形式。
– 理解复杂指令并结合上下文,创造出具有真实感的第一人称视角图像。
与之前的图像生成模型 DALL・E 不同,GPT-4o 采用了一种自回归模型,原生嵌入在 ChatGPT 中。这意味着,它能够处理多达10至20个不同物体的复杂指令,而竞争对手通常只能处理5至8个,展现出更强的能力。
用户只需简洁地描述需求,比如指定纵横比、颜色或透明背景,模型便可以快速生成图像。虽然渲染较复杂的细节可能需要稍等一会儿,但最终的效果是值得的。
在一次发布会上,演示者展示了多个具体案例。比如,他将一张合影转化为动漫风格的图像,模型不仅成功保留了人物的特征,还完美融合了动漫视觉效果。此外,演示者要求生成一页关于相对论的幽默漫画,结果生成的漫画不仅结构完整,还生动有趣。
OpenAI 对此功能的安全性也非常重视,所有生成的图像都带有 C2PA 元数据标识,确保内容的来源可追溯,并有效阻止不当请求的生成。
当然,OpenAI 的图像生成工具并非没有缺点,比如在裁剪、上下文理解和非拉丁文本渲染等方面仍存在不足。不过,OpenAI 表示他们会在未来不断优化这些问题。
与此同时,Google 也在同一时间发布了自家的强大 AI 模型 Gemini2.5Pro Experimental,展现出在推理和编程能力上的显著提升。这一系列的动态显示出,AI 领域的竞争愈发激烈,各大科技巨头都在不断推出更先进的技术,力争在这场 “AI 争霸战” 中占据领先地位。
上一篇: 苹果有望收购前OpenAI女掌门新公司ThinkingMachinesLab,Siri或将重塑
据科技媒体 Business Insider 报道,苹果公司可能正在考虑通过一项数百亿美元的交易,来提升其在人工智能(AI)领域的竞争力。前 OpenAI 首席技术官 Mira Murati 所创立的 Thinking Machines Lab 成为了苹果的潜
下一篇: 谷歌发布全新推理AI模型Gemini2.5和Gemini2.5Pro实验版
近日,谷歌在开发者平台 Google AI Studio 及 Gemini 应用程序上发布了其最新的人工智能推理模型 ——Gemini2 5。此模型具备停下来 “思考” 的能力,标志着人工智能技术的新进步。谷歌还推出了 Gemini2 5Pro Experim
相关攻略 更多
最新资讯 更多
AI语音独角兽ElevenLabs完成2.5亿美元C轮融资,估值突破30亿
更新时间:2025-04-29
百川智能推出国内首个全场景深度思考医疗大模型,革新医学推理方式
更新时间:2025-04-29
奥特曼加码长寿科技:RetroBiosciences欲筹10亿美元,挑战人类寿命极限
更新时间:2025-04-29
OpenAI新成立的PBC部门估值达300亿美元,微软投资股份尚未确定
更新时间:2025-04-29
扎克伯格表示,2025年底Meta将拥有130万个用于AI的GPU
更新时间:2025-04-29
德勤:企业在推行生成式AI项目上面临规模化挑战
更新时间:2025-04-29
AI基础设施争夺战愈演愈烈:OpenAI与微软的微妙关系
更新时间:2025-04-29
聊天机器人平台CharacterAI以第一修正案为由申请驳回与青少年自杀案的诉讼
更新时间:2025-04-29
Deezer日均上传超万首AI音乐,平台开始检测与标记
更新时间:2025-04-29
AI创业公司GameOn创始人与律师妻子被控6000万美元投资诈骗
更新时间:2025-04-29