关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
小妹毛豆像一个“陪伴型机器人”,虽然有时因为精力爆棚、孩童声音过尖而过于闹腾,被爷爷辣评“粘刺刺蜂”,但孩子的童真又能弥补老人的空虚,比小猫更活泼,更有陪伴感。突然就懂了老人想抱孙子的想法。我整整比小妹大20岁,想到爷爷奶奶从这么小看着我长大,也是挺感慨的。有时爷爷奶奶因为小妹的笑话大笑时,竟也有点吃醋。真是神奇的人类情感。
海螺语音上线,测试了一下这可能是国内最好的配音产品了

支持超过17 种语言的配音
多种情绪表达的精准控制
支持数百种音色库满足不同需求
音频质量真的非常高,清晰、自然
提供丰富的自定义选项

海螺语音的功能真的很强大而且细致,有一个庞大的音色库支持超过17种语言,每种语言又有非常多的音色,再加上男声和女声还有年龄。

可以通过筛选找到你需要的任何身份和年龄背景的音色,比如我们的视频脚本需要一个年迈的有正义感的老人,就可通过这个筛选快速获取到。

另外在选择了音色后也可以对音色进行非常详细的自定义。我们通过控制这四个自定义选项,可以调教出非常不同的声音,即使你选的同一个音色,真的很好玩,可以试试。

海螺的模型本体也非常强大,很多模型最常见的问题就是音质问题,有股电流感,我找了一段我前段时间写的相对较长的内容让他生成了一下口播稿,可以听一下音质非常好,而且停顿自然,需要着重强调的时候他会加重读音。

另外一个语音模型的常见问题是超长内容的生成,很多支持的文字长度很短,海螺支持单词输入10000字符,基本上长点的稿子和一章小说也就这个长度了,完全可以满足需求。

介绍就到这里可以多玩玩,在下面这几个地方使用:
海螺语音:https://hailuoai.com/audioHailuo
国内API服务:https://platform.minimaxi.com/document/T2A%20V2

Invalid media: video
AI探索指南
Kimi和DeepSeek的新模型这几天内同时发布,又是一波让人看不懂的突飞猛进,硅谷的反应也很有意思, 已经不再是惊讶「他们是怎么办到的」,而是变成了「他们是怎么能这么快的」,就快走完了质疑、理解、成为的三段论。 先说背景。大模型在运作上可用粗略分为训练和推理两大部分,在去年9月之前,训练的质量一直被视为重中之重,也就是通过所谓的算力堆叠,搭建万卡集群甚至十万卡集群来让大模型充分学习人类语料,去解决智能的进化。 为什么去年9月是个关键的转折点呢?因为OpenAI发布了GPT-o1,以思维链(Chain…
DeepSeek一直是「扮猪吃老虎」的角色,不但是价格战的发起者,600万美元训练出GPT-4o级模型的测试结果,更是让它一战成名,而Kimi正好相反,它的产品能力很强,有用户,甚至还为行业贡献了足够的融资八卦,但在科研方面,除了都知道杨植麟是个牛逼的人之外,其实还是不太被看到。

这次就不一样了,DeepSeek不再是一枝独秀,Kimi也把肌肉秀到了人家脸上,Kimi k1.5满血版在6项主流基准测试里和o1同台竞赛,拿到了3胜1平2负的结果,已经完全称得上是平起平坐了。

Kimi在GitHub上开源了k1.5的论文,分享了实现原理,最重要的一条是long2short,什么意思呢,就是让长思维链模型去当老师,教会短思维链模型同样的思考方式。

类o1的思维链模型什么都好,就是成本太高了,对于大多数普通人来说,「用得上但用不起」是最大的障碍,所以只有能够把AI用作生产力的专业人员,才能「回本」,甚至连OpenAI都没法通过高定价达成盈亏平衡,Sam Altman说200美金/月的ChatGPT Pro——可以毫无心理负担的使用o1——在账面上是亏损的,因为o1被调用的频次太高了⋯⋯

如果说DeepSeek V3是在训练层戳破了必须要囤上几万张卡才能上牌桌的神话,那么Kimi 1.5就是在推理层推翻了思维链含着金汤匙出生就是要烧钱换质量的判断。

long2short也有点模型蒸馏的意思,本质上是利用极致的压缩能力实现「降本等效」的需要,k1.5分为long-CoT(长思维链)和short-CoT(短思维链)两个版本,但是很明显的,相比long-CoT对于长板的挑战,short-CoT对于短板的补足价值更有吸引力。

简单来说,就是和包括DeepSeek V3在内的竞争对手比起来,达到同样的水平,Kimi k1.5消耗的token量最少,如果把可消耗的token量提高到同一数值,Kimi k1.5的表现又回一骑绝尘,同质量最便宜,同价格最优质,就是这么不讲道理。

Kimi的论文里强调了长上下文的压缩是这套long2short方法的关键所在,这就有点让人感慨了,不知道你们还记不记得,Kimi当初的出圈,就是因为对长上下文的支持,刚发布时的20万字处理上限,刷新了行业纪录,后来长上下文也一直是Kimi的特色标签,但谁又能想到,对于长上下文的压缩优势,还能穿越山海,让Kimi在思维链的长短压缩场景里也能复用。

更早些时候,晚点对MiniMax创始人闫俊杰的采访里,闫也说了,公司采用全新架构的原因,就是意识到长上下文很重要,它是大模型发生通讯的核心能力。

只能说,过去的一切积累都会成为未来的慷慨馈赠。

和中美人民在小红书里重新相遇很像,两个国家在AI技术上的交流和互动其实也很密集,虽然政治上有芯片禁售等情况,但在从业者的圈子里,看不到太多的意识形态,腾讯的财报会议直接都说了,几乎全公司的程序员都在用Copilot写代码,而DeepSeek和Kimi把模型成本打下去的动作,也证明了在经济易用这条路上,国产公司是走得最远的。

这就勾画出了一个非常明确的趋势,美国的AI厂商负责前沿探索,烧最多的钱,出最好的货——你可以发现目前o3还是同行们不敢碰瓷的,都会默默绕开,哈哈——中国的AI厂商负责务实,在更贴近现实需求的领域里,提供最全面的优化,让AI变得好用。

这真的是未曾想过的配合。

朋友圈里有人转过一张群聊截图,我觉得很符合AI发展的方向,内容是宝玉发了一个react动画库的网址,下面的消息回复是:「谢谢推荐,我让Cursor学习下。」

哥飞对此感慨道:注意到区别了吗?如果是在以前,这个回复应该是「谢谢推荐,我学习下」。

时代就是这么悄然改变的。
Kimi和DeepSeek的新模型这几天内同时发布,又是一波让人看不懂的突飞猛进,硅谷的反应也很有意思, 已经不再是惊讶「他们是怎么办到的」,而是变成了「他们是怎么能这么快的」,就快走完了质疑、理解、成为的三段论。

先说背景。大模型在运作上可用粗略分为训练和推理两大部分,在去年9月之前,训练的质量一直被视为重中之重,也就是通过所谓的算力堆叠,搭建万卡集群甚至十万卡集群来让大模型充分学习人类语料,去解决智能的进化。

为什么去年9月是个关键的转折点呢?因为OpenAI发布了GPT-o1,以思维链(Chain-of-Thought)的方式大幅提高了模型能力。

在那之前,行业里其实都在等GPT-5,以为一年以来传得沸沸扬扬的Q*就是GPT-5,对o1这条路线的准备严重不足,但这也不是说o1不能打,它的强大是在另一个层面,如果说训练能让AI变得更聪明,那么推理就会让AI变得更有用。

从o1到o3,OpenAI的方向都很明确,就是变着法儿奔向AGI,一招不行就换另一招,永远都有对策,大家平时对于OpenAI的调侃和批评很多,但那都是建立在高预期的前提下,真不要以为OpenAI没后劲了,事实上每次都还是它在推动最前沿的技术创新,踩出一条小径后别人才敢放心大胆的跟上去。

AI大厂们一直不太承认训练撞墙的问题,这涉及到扩展法则(Scaling Law)——只要有更多的数据和算力,大模型就能持续进步——有没有失效的问题,因为可被训练的全网数据早就被抓取殆尽了,没有新的知识增量,大模型的智能也就面临着无源之水的困局。

于是从训练到推理的重点转移,成了差不多半年以来最新的行业共识,推理采用的技术是强化学习(RL),让模型学会评估自己的预测并持续改进,这不是新东西,AlphaGo和GPT-4都是强化学习的受益者,但o1的思维链又把强化学习的效果往前推进了一大步,实现了用推理时间换推理质量的正比飞跃。

给AI越充分的思考时间,AI就能越缜密的输出答案,是不是有点像新的扩展法则?只不过这个扩展在于推理而非训练阶段。

理解了上述背景,才能理解Kimi和DeepSeek在做的事情有什么价值。
字节豆包:不是没有数据飞轮,是……
如果你之前一直因为自己没啥编码需求而没有尝试过付费的 Cursor,那么你现在可以趁着字节免费,试着用一下 Trae 写稿而不是写代码。
类 Cursor 模式的 Agent 可以把 4o 和 Claude 3.5 Sonnet 这种原本不带 CoT 的模型通过工程化产生 CoT。
并且,和 o1、o1 Pro 这种原生使用复杂推理的模型不同的是,由于它原本是为写代码设计的,所以它每个步骤的输出(推理过程)都需要经过你的手工确认。
这意味着你不用等到它给出错误答案后再告诉它如何调整,可以直接控制它 CoT 过程中每一步的对错。
这对写稿来说,能显著增加你对 AI 生成内容的控制。
避免那种洋洋洒洒一堆写出来,但方向错了。
总的来说,一年过去了,AI 创作工具依然还难用。但有些机会。
FjOoGwlLgtZfGcL0KQD094cgHDDWv3.jpg
661.8 KB
腾讯发布了 AI 全流程产品混元3D创作引擎

只需要一句话就能生产带骨骼动画的完整3D 角色

AI 不止用在了单纯的模型生成,还涉及到了非常多的模型后处理

还有类似 Comfyui 的 3D 工作流功能,极大的提高了自由度和效率

还开源了最强的 DiT 3D 生成模型 Hunyuan3D-2 !

图生和文生是最基础的 3D 生成功能,混元 3D 创作引擎也都支持,但是比较强的是他支持直接生成低多边形和 PBR 贴图的版本。

低多边形在游戏领域非常有帮助,面数越多对硬件的计算压力也就越大,现在可以直接生成。

生成 PBR 贴图生成功能也很强大和基础的颜色贴图不同的是,PBR贴图系统相比基础颜色贴图能够创造出更加真实和丰富的视觉效果。

在生成结束后混元 3D 生成引擎也提供了丰富的后处理功能:

如果是人形或者动物的 3D 模型可以选择绑定骨骼,绑定结束后可以直接生成对应的动画预览

可以自主选择后处理的低多边形效果和强度

还提供了自定义渲染打光的能力,能够自定义光线的颜色和位置,连射灯和平面光强度都可以自定义

除了基础的 3D 生成能力他们还上线了一个实验室,里面有很多新的 AI 3D 能力。

3D 动画生成:上传模型自动绑定骨骼生成预设的动画

草图生 3D:从黑白线条草图生成 3D 模型,这个的优势是可以通过文字生成不同的风格贴图

3D 纹理生成:为白模生成不同风格的贴图,比如更换颜色和材质

3D 人物生成:从人像照片生成 3D 人物,这个在元宝里面也有

你可以在这里创建类似 Comfyui 的 3D 生成工作流,能够添加不同的节点构建符合自己需求的 3D 生成流程。

比如内置的文生角色工作流,就是从输入提示词开始到生成图片然后在进行分割,然后比例标准化,每一步你都能控制。

Hunyuan3D 的 2.0 版本模型,首个开源的高质3D-DiT生成大模型。同时支持文生3D和图生3D功能。而且开源的非常完整模型算法、模型权重和推理代码等完整资源都开源了。

相较于 1.0,2.0 会先生成裸网格,再为网格合成纹理贴图。这种策略有效地将形状和纹理的生成难度分离,并提供了灵活性,以便对生成的或手工制作的网格进行纹理化。

这里尝试混元 3D 生成引擎:https://3d.hunyuan.tencent.com
细思极恐 DeepSeek-R1-Zero 的顿悟时刻。

在 DeepSeek-R1-Zero 的训练过程中观察到的一个特别有趣的现象是“Aha Moment”的出现。

如图所示,这个时刻发生在模型的中间版本中。在这个阶段,DeepSeek-R1-Zero 通过重新评估其初始方法,学会为问题分配更多的思考时间。

「等等,等等。等等。 这是我可以标记的一个顿悟时刻。
让我们逐步重新评估,以确定是否可以得到正确的总数 · · ·」

该模型学会使用拟人化的语气重新思考。
这对我们来说也是一个顿悟的时刻。
让我们见证了强化学习的力量和美丽。
实测被豆包实时语音钓成翘嘴🍵

Invalid media: video
小红书的AI翻译为什么这么快? 因为提前翻译做了缓存。如何推导实现逻辑:

1. 大模型的速度基本是一个字一个字吐出来,不可能一点翻译,立马展示翻译。所以判断,肯定是提前做了翻译缓存

2. 如何验证上述猜想?反复点击翻译,你会发现每次的结果都一样,否则每次点击调用大模型,结果会不一样。

3. 那应该什么时候把评论送翻呢,会不会存在还没翻译完,其他用户就点击翻译评论? 一个合规知识,你在互联网上看到的所有内容其实都经过审核,评论更不例外。用户写了评论,送去机器审核,同时拿去翻译,等审核通过后,大概率翻译结果也返回了,所以用户看到评论原文时,译文几乎也都同时存在了
Back to Top