关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
今天解锁了Claude的新使用场景:将一场周例会的录音asr之后发给Claude让它生成会议纪要和todo项。

一句话评价:比最好的实习生总结的还要好。

然后把结果转发给小美听写(公司内部会议录音软件)的PM,她看到了Claude输出的内容直呼卧槽。按她的说法:总结会上全讲了什么很容易,知道哪部分是重点哪部分不是重点很难,准确地整理好todo项非常难(gpt4和大部分实习生都做不好),而Claude的表现真的堪称完美。

顺便我俩一起感慨了一下,这几个月做了很多prompt engineering的工作,在更强大的模型面前不值一提。

评论区可以留言还有哪些场景想测试Claude opus的能力。
零一万物发布 Yi-9B 大语言模型,在代码、数学、常识推理和阅读理解方面表现出色。接受 3 万亿Token培训。英汉双语。#ai#

这里下载模型:网页链接
将@张小珺 采访杨植麟和朱啸虎的两篇文章喂给Google的Gemini 1.5 Pro,它总结出了对11件事情的不同看法,仅供参考😊
FnqRm9SNj7_SIHU6djAk2okk0GIQv3.jpg
1.3 MB
Reddit 上的一个帖子,很厉害,利用简陋的 3D 模型动画和 Animatediff 生成 高度自定义的 2D 动画。#ai#

B 站前段时间胶囊计划有个片子也是类似的处理方式。

具体的工作流为:

将文本转化为3D效果: 由LumaLabs提供技术支持

背景设计: 使用ComfyUI和Photoshop的生成式填充功能

3D动画制作: 采用Mixamo和Blender工具

2D风格动画: 由ComfyUI提供支持

所有其他特效: 通过After Effects实现 歸藏的AI工具箱的微博视频
发现一个很有意思的应用 Simply News,它会使用 Agents 查找特定领域的新闻内容自动生成播客。

相对于 AI 生成视频,现在来看自动个生成对应播客的技术可能更成熟,最近也看到了很多探索,比如 Perplexity 也有个类似的播客。

他们的 Agents 主要由四部分组成:

The Sorter:扫描大量新闻源,根据文章的相关性和对播客类别的重要性进行筛选。

The Pitcher:为每篇筛选出的文章制作引人入胜的提案,考虑文章呈现的叙事角度。

The Judge:评估提案并做出编辑决定,选择哪些应该被报道。

The Scripter:为Judge选中的文章草拟吸引人的脚本,确保听众能清晰、准确地理解。

这里收听:https://www.simplynews.ai/
看完朱啸虎那篇新闻,不吐不快。Analogy 类比,其实在商业上是一种很容易出错的因果模型。

苹果在2007年推出iPhone时,许多行业专家预测它不会成功。他们直接把 iPhone 类比成Macintosh 个人电脑,会因为跟 PC + wintel 组合的价格竞争而无利可图。站在 08年,用智能手机与旧的个人电脑业务进行类比,看上去非常符合逻辑。

同样的错误也出现在桌面互联网跟移动互联网的类比,vr/ar 跟智能手机的类比。这还是同一个品类的类比,就出现了如此多的错误。

何况是大模型这个人类历史上从未出现过的品类,人工智能还算是科幻作品能够想象出来的发明,至于区块链/btc 这类科幻作品都写不出来的发明,拿什么去类比呢?在互联网真的普及之前,adwords 这种商业模式你用什么类比能预测呢?免费这种商业模式你用什么类比能预测呢?

大部分中国投资人,特别喜欢用后视镜进行定性/类比,特别无法接受未知,一定要在一个早期时间点下论断/结论/预测。要不然就会焦虑,个人觉得可能是中国历史的强规律感外加应试教育的标准答案导致的吧。

计算是不可约的,这是wolfram 的核心观点,我们永远无法找到描述系统中将要发生的事情的“公式”或“快捷方式”——因为这些系统在计算上是不可约的。任何复杂系统本质上都是没有公式、没有理论、没有捷径、不可概括、不可预测的。要知道发生了什么,得遍历所有过程,我们不能指望找到一个“简单的叙述”来“说明为什么会发生某事”。我们可能找到一些局部规律,但每个局部规律的发现,总会带给我们更多的未知。

未来也是不可约的,我们应该享受这个未知/不确定性,而不是享受结论/确定性。
发现一个很有意思的应用 Simply News,它会使用 Agents 查找特定领域的新闻内容自动生成播客。#ai#

相对于 AI 生成视频,现在来看自动个生成对应播客的技术可能更成熟,最近也看到了很多探索,比如 Perplexity 也有个类似的播客。

他们的 Agents 主要由四部分组成:

The Sorter:扫描大量新闻源,根据文章的相关性和对播客类别的重要性进行筛选。

The Pitcher:为每篇筛选出的文章制作引人入胜的提案,考虑文章呈现的叙事角度。

The Judge:评估提案并做出编辑决定,选择哪些应该被报道。

The Scripter:为Judge选中的文章草拟吸引人的脚本,确保听众能清晰、准确地理解。 歸藏的AI工具箱的微博视频
Anthropic AI 官方工作人员发布了对 Claude 3 系统提示每部分的详细解释。#ai##claude3#

我做了张对照的长图帮大家学一下 LLM 的系统提示词应该怎么写,包含哪些内容。
忍不住再推荐一次 Layer Diffusion,直接生成 PNG 素材真的对设计师太太太友好了~~~~~甚至能直接生成发丝和透明玻璃杯!

这工作流兼容 SDXL 系列的所有模型和 Lora,我用的模型是 DreamshaperXL Turbo,4~8步就能生成效果很好的素材,直接把生成速度压缩到秒级,见图1。

插件安装和部署:https://github.com/huchenlei/ComfyUI-layerdiffusion
DreamShaper XL 下载:https://civitai.com/models/112902/dreamshaper-xl

最近和@海辛Hyacinth 做的鸡尾酒单就是用它来加的装饰素材(https://m.okjike.com/originalPosts/65e34fee38849f879fc12483?s=ewoidSI6ICI2MzkwNTUwZTljMzFjOGZjMWM3NzIyMzIiCn0=)

☁️

你甚至可以把整个流程反过来 —— 给现成的 PNG 素材生成背景,工作流见图7。 这简直是所有产品展示场景的刚需!

☁️

最后补充一个冷知识:Layer Diffusion 的作者之一就是 Controlnet 的作者 Lvmin Zhang~!

谢谢,不愧是你!

#AI绘画
AI探索指南
微软和 Deepmind 的一篇论文探讨利用 LLM 从设计生成代码,这个实践经验对想做相关 Design2Code 工具的很有参考性。#ai# 我整理了一下里面对我们自己通过 LLM 生成代码可能有用的提示词和经验。感兴趣可以看看。 他们发现第一次生成的网页通常质量不太行,但是第二次增强提示之后 GPT-4V 生成网页代码质量明显变好,下面是对应提示词。 第一次代码生成提示词: 假设你是一位精通HTML和CSS的网页开发专家。当用户提供一张网页的截图给你时,你的任务是创建一个HTML文件。这个文…
◆使用真实世界的网页内容来训练开放源代码的多模态大语言模型。我们的初步实验表明,直接在真实的网页上进行训练存在挑战,因为这些网页往往内容繁杂、数据杂乱。未来的研究可能会探索数据清洗和优化的方法,以实现更稳定有效的训练过程。

◆超越传统的截图输入方式,例如,尝试使用前端设计师的Figma框架或手绘草图作为测试输入。这种方法的扩展还需要我们仔细地重新设计评估体系。

◆将研究范围从静态网页扩展到动态网页。这意味着评估过程需要考虑网页的交互功能,而不仅仅是视觉效果的相似性。

项目地址:网页链接
微软和 Deepmind 的一篇论文探讨利用 LLM 从设计生成代码,这个实践经验对想做相关 Design2Code 工具的很有参考性。#ai#

我整理了一下里面对我们自己通过 LLM 生成代码可能有用的提示词和经验。感兴趣可以看看。

他们发现第一次生成的网页通常质量不太行,但是第二次增强提示之后 GPT-4V 生成网页代码质量明显变好,下面是对应提示词。

第一次代码生成提示词:

假设你是一位精通HTML和CSS的网页开发专家。当用户提供一张网页的截图给你时,你的任务是创建一个HTML文件。这个文件需要用HTML和CSS编码来精确还原截图中的网站设计。重要的是,所有的CSS样式代码都要直接写在HTML文件里,而不是链接到其他文件。

如果原网页中有图片,你可以用一个名为"rick.jpg"的图片作为所有图片的替代品。即便网页中的某些图片已经被蓝色的矩形占位符替代了,你同样需要使用"rick.jpg"作为这些位置的图片。记住,你的HTML文件中不应包含任何外部文件的链接。

此外,这个任务不需要你使用JavaScript编写动态交互脚本。你的重点应该放在复原网页元素的大小、文本、位置、颜色以及整体布局上。最终,你需要提供完整的HTML文件内容,其中包含了所有必要的CSS样式代码。

增强提示词:

作为一名擅长HTML和CSS的网页开发高手,你面临的挑战是修改一个已有的HTML文件。这个文件是用来构建一个网页的,但它目前有一些缺失或错误的部分,使得它与原网页有所不同。我将向你展示我想要创建的网页原型和目前HTML实现的网页效果。同时,我也会提供你我想在网页中包含的所有文本。

你的任务是仔细比较这两个网页,并根据提供的文本内容,修改原始的HTML代码。你需要确保新的实现在外观上与参考网页完全一致。在编码时,要保证HTML代码语法正确,能够生成一个结构完整的网页。对于需要图片的地方,你可以暂时用一个名为"rick.jpg"的图片作为占位符。

在进行代码修订时,请特别注意网页元素的大小、文本内容、位置布局和颜色等方面,确保最终的布局和原网页高度相似。完成后,请直接提供新修订的HTML文件内容,无需附加任何解释。

LLM 通过设计生成代码未来重点和研究方向:

◆为多模态大语言模型开发更有效的提示技巧,尤其是在处理复杂网页设计时,例如通过分步骤生成网页的不同部分。
Open AI 公布了和马斯克的邮件往来,来应对马斯克的诉讼,终于又在 Open AI 的文件中看到了Ilya的名字。看来还是没有完全闹掰。#ai#

我大致总结了一下声明的内容,里面邮件被涂掉的内容才是最重要的。

声明总结:

OpenAI发布了一篇博客,详细介绍了其与埃隆·马斯克(Elon Musk)的关系以及公司的使命。OpenAI的使命是确保人工通用智能(AGI)惠及全人类,这不仅包括构建安全、有益的AGI,还包括帮助创造广泛分布的利益。OpenAI意识到,构建AGI将需要比最初想象的更多资源。马斯克建议宣布对OpenAI的初始10亿美元资金承诺。自2015年底成立以来,该非营利组织从马斯克那里筹集了不到4500万美元,从其他捐赠者那里筹集了超过9000万美元。

在讨论为了进一步使命而采取的营利性结构时,马斯克希望OpenAI与特斯拉合并,或者他希望拥有完全控制权。最终,马斯克离开了OpenAI,表示需要有一个能与谷歌/DeepMind竞争的相关对手,并且他将自己去做。2017年底,OpenAI和马斯克决定下一步是创建一个营利性实体。马斯克希望拥有多数股权、最初的董事会控制权,并担任CEO。在这些讨论中,他暂停了资金支持。

OpenAI强调,他们通过构建广泛可用的有益工具来推进使命,使技术在赋能人们和改善他们的日常生活方面广泛可用,包括通过开源贡献。例如,阿尔巴尼亚利用OpenAI的工具加速其加入欧盟的进程长达5.5年;Digital Green通过在OpenAI的基础上构建,帮助肯尼亚和印度的农民收入提高了100倍;罗德岛最大的医疗保健提供者Lifespan使用GPT-4简化其手术同意书,从大学阅读级别简化到六年级水平;冰岛使用GPT-4保护冰岛语言。

马斯克理解使命并不意味着开源AGI。随着OpenAI接近构建AI的目标,他们开始变得不那么开放。OpenAI表示,他们对与曾经深受尊敬、激励他们设定更高目标的人——马斯克的关系走到这一步感到遗憾,尽管他后来告诉他们他们会失败,启动了一个竞争对手,然后在他们开始朝着OpenAI的使命取得有意义的进展时起诉他们。OpenAI专注于推进其使命,并且还有很长的路要走。随着他们继续改进工具,他们兴奋地部署这些系统,以便赋能每个人。

全文:网页链接
今天和Claude Opus一起工作了一天,提效非常明显:

1. 数据分析场景:把需要查询的几张表的表结构和select * from xxx limit 10的结果发给Claude,说一下几张表的关联关系,然后说我想要查询xxx,让Claude直接给我写sql,然后无脑粘贴进bi平台查询,基本上嵌套关系在三层以内的sql都不会出错。另外把数据分析的结果发给Claude,让它给我补充分析背景和分析结论,非常好用,我只需再补充一些后续产品todo即可。不方便的地方是没有code interpreter所以不能像在ChatGPT里那样直接帮我把图表也给画了。

2. PRD场景:直接把实习生写的PRD复制粘贴发给Claude,让它挑刺,给出来的建议非常的客观具体详实,是一个比我好很多的产品mentor。

补充: Claude模型能力和GPT4比哪个更强不好评价,但long context无损压缩的用户体验好太多了。自从OpenAI devday搞了Assistant api之后,在chatgpt上第n轮交互不一定会把前几轮的Query和answer放到上下文。这就造成,我如果把所有背景在一轮交互里都讲清楚了,gpt4很完美,但如果问followup questions它就表现的很垃圾。我坚信目前这些在工程上carefully arrange context window来节约成本的都是雕花行为,long context才是新时代的摩尔定律。
伴随 Claude 3 推出的还有一个提示词库,里面有Anthropic提供的非常多的示例提示词,方便开发者和用户尝试。

详情页还给出了对应提示词的示例回答和 API,可以去看看学一下 Claude 的提示词写法。

这里访问:https://docs.anthropic.com/claude/prompt-library
Back to Top