关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
等了许久的自研DiT视频生成大模型终于官宣,其实几个月前就开始做应用层的工程化链路,等ready后,就可以开放给用户使用
1. 媒体上看到的都是good case,但和用户在真实创作生产力环境下的预期,依然存在一定的gap。比如普通用户很难接受高频的抽卡,尤其每次抽卡又慢又费钱,也写不好prompt
2. 大模型可以生成几乎任何的视频,但是很多视频效果都不一定好。所以需要找到适合的场景,来满足该场景下用户的预期,例如AI拥抱就是很好的玩法,希望还是让更多的人玩起来,通过聚集更多人的创意来演化出更复杂的内容,而不是少数AI圈内创作者的自嗨
3. 在视频编辑器里,视频生成模型的价值:1)AI底素材生成,弥补用户素材缺失;2)效果包装,比如做视频的风格化、局部重绘、两个视频之间的无缝转场,比如跟文字、贴纸等已有包装元素的叠加,就有了指数级增加的丰富效果;3)通过模板生态,把少数创作者的创意变成普适性的大众玩法,一键套用,形成全民热度
4. DiT的推理成本太高了,每一次调用都是钱,在剪映Capcut的体量下,如何做成本优化、定价策略、等待体验,都是很细很杂又很重要的活儿,时不时的卡资源就打爆了。当然更期待明年底层模型的推理成本可以降低,这样规模才会有真正量级上的突破
天才想法,甄嬛传高光片段印度版。
剪辑一些影视剧的经典镜头,然后用 Runway V2V 转成别的主题,非常容易起量,又避免了原创问题。
这么多优秀的视频数据上传到 Runway,估计下个版本模型能力要起飞了。
视频来自抖音赛博影业。
Invalid media: video
剪辑一些影视剧的经典镜头,然后用 Runway V2V 转成别的主题,非常容易起量,又避免了原创问题。
这么多优秀的视频数据上传到 Runway,估计下个版本模型能力要起飞了。
视频来自抖音赛博影业。
Invalid media: video
如果你会写作就会写Prompt, 你输出Prompt 意味着开始探索与AI 对话的方式。
核心在于,清晰地思考就能真正撬动AI的杠杆力;它远远不是效率工具这么简单,它可以成为任何一种技能的专家,各种维度的超级助手和创意伙伴。
换句话说, 写Prompt 核心技能在于你持续清晰思考的能力,它依托你的知识体系、职业训练、人文审美,以及无穷无尽的好奇心。 其中最容易被忽视是你的愿景和坚定的目标。
值得一提的是, Prompt Engineering 是在清晰思考之上的一种工程力。你需要有产品sense、工匠精神和项目管理经验, 它的综合素养具有极高的天花板;挑战之处在于,你需要在建构中不断演化和创新。
简言之,认知体系和实践相辅相成,你的思考才可能化为工程与产品,并提供持久的价值;而这个过程的副产品,正是你真正理解AI。
核心在于,清晰地思考就能真正撬动AI的杠杆力;它远远不是效率工具这么简单,它可以成为任何一种技能的专家,各种维度的超级助手和创意伙伴。
换句话说, 写Prompt 核心技能在于你持续清晰思考的能力,它依托你的知识体系、职业训练、人文审美,以及无穷无尽的好奇心。 其中最容易被忽视是你的愿景和坚定的目标。
值得一提的是, Prompt Engineering 是在清晰思考之上的一种工程力。你需要有产品sense、工匠精神和项目管理经验, 它的综合素养具有极高的天花板;挑战之处在于,你需要在建构中不断演化和创新。
简言之,认知体系和实践相辅相成,你的思考才可能化为工程与产品,并提供持久的价值;而这个过程的副产品,正是你真正理解AI。
用 cursor 做了个工具,把播客/音频内容,删除口水话和语气助词后,直接转成排版好的对话网页,并且适配手机端。
不知道有没有机会开发成一个小产品呢?🧐
这条线上下一个想做的小作业:把幽默喜剧类播客内容转成这种格式,并且会有AI高亮的笑点,点击后AI会给你解释为什么好笑🤣
不知道有没有机会开发成一个小产品呢?🧐
这条线上下一个想做的小作业:把幽默喜剧类播客内容转成这种格式,并且会有AI高亮的笑点,点击后AI会给你解释为什么好笑🤣
#AI 远见人物——新一篇
王田苗是中国知名机器人专家,孵化过九号机器人、天智航等公司。
【这次我们不仅聊了他对具身智能的观察
-通用技术突破已发生,但产业落地不会那么快,具身智能要去具体场景去进化。
-今年下半年到明年,人形机器人一定会有泡沫,但产业发展也需要泡沫。
【也聊了科学家创业
-20 年前,王田苗是中国第一批做创业孵化的科学家,他与朋友一起于 2002 年成立的博创兴盛就是孵化器,在意识到自己的短板后,他选择放手让学生干。
-科学家的常见短板:缺乏商业思维,更多从技术创新而需求出发,从事而不是人(人的激励、动力)出发
-他认为科学家创业是否有望成功有两个分水岭:1.是否 All in(或者放手,让学生 all in) 2.是否能获得商业思维
(and——我很喜欢文中的一张插图:
在南极,当一只阿德利企鹅遇到“基地漫游者者”机器人🐧🐧🐧
周末听了Reid Hoffman前段时间在斯坦福讲的一节AI商业课,收获了一个对我认知冲击很大的观点:基于LLM的产品,或许可以成为认知层面的GPS。
怎么理解这个观点呢?让我们先从手机地图说起。在没有电子地图的时代,大家出门都是靠纸质地图,但是纸质地图有两个比较突出的问题,一是比例尺固定,无法放大和缩小,二是无法快速定位到自己当前的位置。这就带来了问题,如果我要出个远门,要么我得做很多很多功课,要么我得找个懂路线的高手带着我,不管是哪种方式,认知或金钱成本都很高。
但是有了手机地图以后,这个问题就慢慢被解决了。比如我要从北京开车去新疆,放在之前光是路线这块就是个很头疼的事情,而现在我只需要打开手机地图设置起点终点,一眼就可以看到接近3000km的路线,路上要经过哪一个高速,哪里有加油站,哪里堵车,都看得清清楚楚,这个时候我心里已经有数了。当我启程的时候,它会在每一个路口引导我往哪个方向走,提醒我接下来的服务区,帮我绕过堵车的路段…. 在长途自驾时,正是因为有了手机地图,我的大量精力可以从繁琐的路线规划上抽离出来,专注于欣赏路上的风景。
那么,让我们从更抽象的角度来思考手机地图,它做了什么事情?
首先,当用户需要做一件本来很复杂的事情(规划驾驶路线)时,它提供了一套宏观的总体解决方案,让用户感知到它的靠谱,愿意使用它。
其次,当用户实际使用它(开启导航)时,每一步都在合适的时间给用户提供了详细的指引,让用户不再需要为繁琐的细节而担心,只需要相信它,它便会带领用户一步步到达终点。
从这种角度讲,手机地图实际上是一个非常伟大的发明,它提供了一种强大的安全感。正是因为有了它,没出过远门的人也可以放心地开始踏上旅途;在陌生的城市里,因为有它,旅行者可以放心地探索城市的每个角落,不用担心找不到回去的路。在它的赋能下,每个人能去的地方更远了。
对于LLM产品来说,其实也是类似的。在OpenAI o1模型的介绍中,我们可以看到它在一些任务中的表现已经可以和PhD媲美,在丰富的世界认知和强大推理能力的加持下,在「地图导航」以外的领域,LLM也可以为用户提供强大的安全感。
之前,面临高山,用户可能望而却步,但是有了LLM之后,TA只需要说出来TA的目标是什么,剩下的,就交给LLM。它不仅会告诉你它完全可以帮你处理这件事,还会在每一步给你详细的指引,而对于用户来说,只需要顺着指引向前走,享受这个过程,最后,与目标不期而遇。这就是认知层面的GPS。
话说,人生不也是一段长途旅行吗?有个GPS当向导,或许会走得更远。
怎么理解这个观点呢?让我们先从手机地图说起。在没有电子地图的时代,大家出门都是靠纸质地图,但是纸质地图有两个比较突出的问题,一是比例尺固定,无法放大和缩小,二是无法快速定位到自己当前的位置。这就带来了问题,如果我要出个远门,要么我得做很多很多功课,要么我得找个懂路线的高手带着我,不管是哪种方式,认知或金钱成本都很高。
但是有了手机地图以后,这个问题就慢慢被解决了。比如我要从北京开车去新疆,放在之前光是路线这块就是个很头疼的事情,而现在我只需要打开手机地图设置起点终点,一眼就可以看到接近3000km的路线,路上要经过哪一个高速,哪里有加油站,哪里堵车,都看得清清楚楚,这个时候我心里已经有数了。当我启程的时候,它会在每一个路口引导我往哪个方向走,提醒我接下来的服务区,帮我绕过堵车的路段…. 在长途自驾时,正是因为有了手机地图,我的大量精力可以从繁琐的路线规划上抽离出来,专注于欣赏路上的风景。
那么,让我们从更抽象的角度来思考手机地图,它做了什么事情?
首先,当用户需要做一件本来很复杂的事情(规划驾驶路线)时,它提供了一套宏观的总体解决方案,让用户感知到它的靠谱,愿意使用它。
其次,当用户实际使用它(开启导航)时,每一步都在合适的时间给用户提供了详细的指引,让用户不再需要为繁琐的细节而担心,只需要相信它,它便会带领用户一步步到达终点。
从这种角度讲,手机地图实际上是一个非常伟大的发明,它提供了一种强大的安全感。正是因为有了它,没出过远门的人也可以放心地开始踏上旅途;在陌生的城市里,因为有它,旅行者可以放心地探索城市的每个角落,不用担心找不到回去的路。在它的赋能下,每个人能去的地方更远了。
对于LLM产品来说,其实也是类似的。在OpenAI o1模型的介绍中,我们可以看到它在一些任务中的表现已经可以和PhD媲美,在丰富的世界认知和强大推理能力的加持下,在「地图导航」以外的领域,LLM也可以为用户提供强大的安全感。
之前,面临高山,用户可能望而却步,但是有了LLM之后,TA只需要说出来TA的目标是什么,剩下的,就交给LLM。它不仅会告诉你它完全可以帮你处理这件事,还会在每一步给你详细的指引,而对于用户来说,只需要顺着指引向前走,享受这个过程,最后,与目标不期而遇。这就是认知层面的GPS。
话说,人生不也是一段长途旅行吗?有个GPS当向导,或许会走得更远。
我一直有一个小需求,是用我的 AI 音色把文字内容做成播客。
可就是这么一个小小的需求,各种方法用了一圈,都特别麻烦。
要么就得自己训练模型...
要么就是2B服务,后台难用的一批...
要么就是只能微信使用,还收费99一个声音...
试完发现就只有 Fish Audio 可以满足我的需求。
- 简单,录音十秒就能克隆自己的声音,还支持上传录音文件克隆朋友的声音
- 易用,打开网页就可以直接合成声音,不用下载APP,不用打开小程序,非常方便
- 免费,其他平台克隆一个声音收100,非常离谱,Fish Audio 克隆声音不要钱,生成500字以内也不要钱,一般内容几百字对个人来说完全够用(更多字数订阅10美金/月也不贵说实话)
Fish 不仅能克隆自己的声音,还提供了一个声音共享社区,里面有各种用户上传的上万种有趣声音可以体验,坤坤,赛马娘,孙笑川,高启强...打开你的想象空间...
另外附上这条推的音频版,全部使用 Fish Audio 克隆和生成,使用剪映美化声音、增加背景音防止被其他人克隆,可以试听一下。
Fish Audio 的网址,记得收藏,以后你一定会用到
https://fish.audio/
可就是这么一个小小的需求,各种方法用了一圈,都特别麻烦。
要么就得自己训练模型...
要么就是2B服务,后台难用的一批...
要么就是只能微信使用,还收费99一个声音...
试完发现就只有 Fish Audio 可以满足我的需求。
- 简单,录音十秒就能克隆自己的声音,还支持上传录音文件克隆朋友的声音
- 易用,打开网页就可以直接合成声音,不用下载APP,不用打开小程序,非常方便
- 免费,其他平台克隆一个声音收100,非常离谱,Fish Audio 克隆声音不要钱,生成500字以内也不要钱,一般内容几百字对个人来说完全够用(更多字数订阅10美金/月也不贵说实话)
Fish 不仅能克隆自己的声音,还提供了一个声音共享社区,里面有各种用户上传的上万种有趣声音可以体验,坤坤,赛马娘,孙笑川,高启强...打开你的想象空间...
另外附上这条推的音频版,全部使用 Fish Audio 克隆和生成,使用剪映美化声音、增加背景音防止被其他人克隆,可以试听一下。
Fish Audio 的网址,记得收藏,以后你一定会用到
https://fish.audio/
1、心态调整:是 AI 就有幻觉,会出错很正常,要相信用适当技巧,能解决问题;
2、有报错,先截图或者复制报错信息给 cursor,让它分析原因,给出修改任务;
3、反复出现报错,可以用左侧栏下方的时间线,把 AI 修改过的文件先调回上一个正常版本,尽量不在反复出错的版本上修改,这里麻烦的点是只能一个一个文件调回老版;
4、⚠️关键的正常版本开发好后,在电脑复制一个文件夹副本,可以在 cursor 把项目改乱,以及修改了太多文件之后,直接用副本文件夹;
5、如果你自己已经认识到,当前项目容易报错,一定要严格执行上面的“3”和“4”之后,再结合报错信息提给 cursor 修改;
6、如果用 composer ,注意多用 save all 先看看效果,而不是用 apply all;
7、❗️新手我建议多用右侧栏的 AI 对话(command+L) 而不是 composer(command+k),因为右侧栏支持发送截图,针对单条代码和分析进行提问,以及更细的分析,有利于我们分析问题,时间长了新手也可能看出不合理和胡说八道的地方😉
8、可以尝试换模型解疑难杂症,点击对话栏最下方尝试换 GPTo1🍓,GPT4O👨⚕️,cursor-small🧑⚕️ 这三位“其他科室”的专家来解决;
9、如果还是解决不了,推荐一下最近发现的“编程老中医㊙️”——claude dev,它最近花 5 分钟帮我解决了一个耗了3 小时,还线上咨询了几名工程师都没有解决的问题,且这位中医可以在 cursor 和 vscode 的插件商店直接安装😅;(后面出教程)
10、UI 类 bug 或者说界面丑的问题,不要上来改细节,先可以尝试让cursor 用某种设计风格,比如苹果的设计风格,google 的设计风格优化界面;
其次也可以把好看的网页截图发它参考,如下图👇👇👇就是我截图 cursor 官网,让它模仿做一个网页,虽然没有完全复制,但审美在线;
UI 细节问题比如字体大小,对齐问题,也最好截图给它看,让它修改。