关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
字节豆包:不是没有数据飞轮,是……
如果你之前一直因为自己没啥编码需求而没有尝试过付费的 Cursor,那么你现在可以趁着字节免费,试着用一下 Trae 写稿而不是写代码。
类 Cursor 模式的 Agent 可以把 4o 和 Claude 3.5 Sonnet 这种原本不带 CoT 的模型通过工程化产生 CoT。
并且,和 o1、o1 Pro 这种原生使用复杂推理的模型不同的是,由于它原本是为写代码设计的,所以它每个步骤的输出(推理过程)都需要经过你的手工确认。
这意味着你不用等到它给出错误答案后再告诉它如何调整,可以直接控制它 CoT 过程中每一步的对错。
这对写稿来说,能显著增加你对 AI 生成内容的控制。
避免那种洋洋洒洒一堆写出来,但方向错了。
总的来说,一年过去了,AI 创作工具依然还难用。但有些机会。
FjOoGwlLgtZfGcL0KQD094cgHDDWv3.jpg
661.8 KB
腾讯发布了 AI 全流程产品混元3D创作引擎

只需要一句话就能生产带骨骼动画的完整3D 角色

AI 不止用在了单纯的模型生成,还涉及到了非常多的模型后处理

还有类似 Comfyui 的 3D 工作流功能,极大的提高了自由度和效率

还开源了最强的 DiT 3D 生成模型 Hunyuan3D-2 !

图生和文生是最基础的 3D 生成功能,混元 3D 创作引擎也都支持,但是比较强的是他支持直接生成低多边形和 PBR 贴图的版本。

低多边形在游戏领域非常有帮助,面数越多对硬件的计算压力也就越大,现在可以直接生成。

生成 PBR 贴图生成功能也很强大和基础的颜色贴图不同的是,PBR贴图系统相比基础颜色贴图能够创造出更加真实和丰富的视觉效果。

在生成结束后混元 3D 生成引擎也提供了丰富的后处理功能:

如果是人形或者动物的 3D 模型可以选择绑定骨骼,绑定结束后可以直接生成对应的动画预览

可以自主选择后处理的低多边形效果和强度

还提供了自定义渲染打光的能力,能够自定义光线的颜色和位置,连射灯和平面光强度都可以自定义

除了基础的 3D 生成能力他们还上线了一个实验室,里面有很多新的 AI 3D 能力。

3D 动画生成:上传模型自动绑定骨骼生成预设的动画

草图生 3D:从黑白线条草图生成 3D 模型,这个的优势是可以通过文字生成不同的风格贴图

3D 纹理生成:为白模生成不同风格的贴图,比如更换颜色和材质

3D 人物生成:从人像照片生成 3D 人物,这个在元宝里面也有

你可以在这里创建类似 Comfyui 的 3D 生成工作流,能够添加不同的节点构建符合自己需求的 3D 生成流程。

比如内置的文生角色工作流,就是从输入提示词开始到生成图片然后在进行分割,然后比例标准化,每一步你都能控制。

Hunyuan3D 的 2.0 版本模型,首个开源的高质3D-DiT生成大模型。同时支持文生3D和图生3D功能。而且开源的非常完整模型算法、模型权重和推理代码等完整资源都开源了。

相较于 1.0,2.0 会先生成裸网格,再为网格合成纹理贴图。这种策略有效地将形状和纹理的生成难度分离,并提供了灵活性,以便对生成的或手工制作的网格进行纹理化。

这里尝试混元 3D 生成引擎:https://3d.hunyuan.tencent.com
细思极恐 DeepSeek-R1-Zero 的顿悟时刻。

在 DeepSeek-R1-Zero 的训练过程中观察到的一个特别有趣的现象是“Aha Moment”的出现。

如图所示,这个时刻发生在模型的中间版本中。在这个阶段,DeepSeek-R1-Zero 通过重新评估其初始方法,学会为问题分配更多的思考时间。

「等等,等等。等等。 这是我可以标记的一个顿悟时刻。
让我们逐步重新评估,以确定是否可以得到正确的总数 · · ·」

该模型学会使用拟人化的语气重新思考。
这对我们来说也是一个顿悟的时刻。
让我们见证了强化学习的力量和美丽。
实测被豆包实时语音钓成翘嘴🍵

Invalid media: video
小红书的AI翻译为什么这么快? 因为提前翻译做了缓存。如何推导实现逻辑:

1. 大模型的速度基本是一个字一个字吐出来,不可能一点翻译,立马展示翻译。所以判断,肯定是提前做了翻译缓存

2. 如何验证上述猜想?反复点击翻译,你会发现每次的结果都一样,否则每次点击调用大模型,结果会不一样。

3. 那应该什么时候把评论送翻呢,会不会存在还没翻译完,其他用户就点击翻译评论? 一个合规知识,你在互联网上看到的所有内容其实都经过审核,评论更不例外。用户写了评论,送去机器审核,同时拿去翻译,等审核通过后,大概率翻译结果也返回了,所以用户看到评论原文时,译文几乎也都同时存在了
几年摸索下来,AI行业一直在不断推翻曾经的预判,很有意思。

晚点对MiniMax创始人闫俊杰的那篇采访传得很广,主要的话题点在于闫抛了好几条非共识出来,比如模型能力和用户规模之间不存在飞轮,甚至如果用户太多,反而有可能分散公司的注意力,拖慢前言研发的效率。

我刷到潘乱对此的评论有些不以为然,说要警惕这种180度大转弯的所谓反思,动辄否认行业积累下来的经验总和。与其觉得全世界都在开倒车,不如好好看清楚是不是自个在逆行。

怎么说呢,我是觉得,「在自己生命的每个阶段都说了自己相信的东西」是每个人都不可避免的规律,不算特别难以理解,尤其是在一个格外年轻的行业,从业者都还是在满天的不确定性里找微弱的确定性。

再举一个例子,不知道你们有没有注意到,例如新榜等越来越多的AI产品榜单,开始把夸克、WPS或是百度文库这样的所谓「非AI原生应用」列进去了,这在半年以前还是不太见得到的事情。

也有越来越多的公司意识到,所谓的「AI原生应用」好像是个废话,就好比现在没有手机厂商会强调说新发布了一款触屏手机,出于对AI的敬畏和狂热,大家本来想等出一个iPhone时刻,等出一个漫威宇宙里的贾维斯出来,但在市场端,用户对于AI能力是否原生根本没有执念,他们只看有没有解决具体的问题。

豆包PC端越来越像一个浏览器,百度新上的AI搜也在做集成,基本上都是夸克半年前就开始走的设计思路,突然间行业里全反应过来了,对话式问答不是标准答案,没必要为了AI而AI,在用户熟悉的场景里先建立使用并依赖AI的范式,才是见效最快的。

夸克这款产品我之前提过很多次,现在虽然已经被捧成了「阿里之光」,但它押宝的路线图其实也被质疑过,在「AI取代搜索」和「AI改变搜索」之间,前者的想象空间和重新洗牌的刺激显然更大,而夸克赌的是后者,认为AI可以让搜索进化,能够「处理」而不是简单的「供给」信息,新能力和原入口可以一体化。

后来发生的剧情都知道了,连ChatGPT都新增了联网搜索的按钮,很多苦于获客压力的同行也纷纷「打不过就加入」,形势永远比人强。

七麦的2024年度统计,夸克累计下载3.7亿次,在AI产品里排在第一名,当然夸克也是做了大量的用户AI功能普及教育,但是如果没有千金散尽还复来的ROI,阿里又怎会为了夸克慷慨以赴。

教育用户很必要,但优先级更高的前提是,尊重用户的需求。
已知有甲、乙、丙三人,分别戴着红帽子、白帽子和黑帽子。甲说:“我戴的不是红帽子。”乙说:“我戴的是白帽子。”丙说:“我戴的不是黑帽子。”已知三人中只有一人说的是真话,那么甲、乙、丙分别戴什么颜色的帽子?
FjRzlwhAcEh_t1i4vEdfzSzHjWgYv3.jpg
2.7 MB
FgZv37OvNf0w9nnt39DlVMc2Z7qCv3.jpg
532.5 KB
Back to Top