关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
写了一个简历生成器Prompt
写简历要注意的点都在里面了
希望对求职的朋友有用。
有需要改进的地方还请告诉我😊
Fv6QrRYRXIernS1-xF_DBzz0nQl-v3.png
927.3 KB
这次被邀请参加了 Woman in AI 的圆桌,第一次以女性的身份被邀请,在参与之前我和我很信任的女性朋友小毛聊了我在这样的场合应该表达什么,以及到底应当如何表达。

最后我决定以性别的视角来进行分享(也是第一次在AI议题上用这个视角)分享时我尝试传达了一个我想了很久但是一直没有机会表达的观点:模型和产品是能传递价值观的。

如果你训练的模型,只能生成并不存在于现实中的高磨皮“性感美女”图像,那或许你的模型向使用者在潜移默化中所传达的价值观就是:“如果我不是长成这样好看的人,那我的照片就不应该出现在社媒。”

而对于自身外貌的审视,会加重使用者的焦虑以及更倾向于放弃站在聚光灯下的机会,这就是为什么女性(或者说至少是以前的我)更爱躲镜头的原因。

如果你的产品在试图告诉用户,存在一种标准化的模版化的美和状态,“标准化”是值得被追求的。那或许你的产品在否定这样的价值观:我们应该找到和成为与众不同的自己,并对自己感到满意。

你的产品或模型如果足够好,那TA一定会触及年轻一代的孩子,我们该向孩子传递怎样的信念?传递怎样我们对世界的看法?我觉得至少有一点是重要的:这个世界有形形色色多种多样的人,但你不用耗尽一生去成为某个TA人虚拟的理想,不用去成为一个“标准化”的角色,你成为与众不同的你自己就足够了。

这就是为什么 AI 里应该有更少的刻板印象和性别凝视,应该有更丰富的多样性和形形色色的人的代表,因为你的人生可以成为任何人。
太牛了这个,直接AI生成图片,可以准确显示文字。
试了一下 ElevenLabs 的新模型 v2,可以克隆中文声音了。用我自己过去播客的音频素材训练了一下。

乍一听很惊人,后面就成了费翔的商务殷语了。

不过未来可期,有的本来就读稿、没有情绪起伏的单口主播们也许真的不用自己录了。

Invalid media: video
微博机器人🤖️😣
我用Midjourney做了《杀死那个石家庄人》MV

朋友们,答应你们的完整版来了

我用midjourney(文生图工具)、Gen-2(文生视频工具)、Pika Lab(文生图+视频工具),用剪映剪辑,爆肝三天三夜做了这个《杀死那个石家庄人》的MV。

剪了200多个视频片段,500多张图片,最终用了50多个,花了不少dollar去买AI工具credit,最终总算把它搞出来了....

这个视频内容100%由AI生成,所有prompt提示词均为《杀死那个石家庄人》歌词,感谢万能青年旅店,感谢AI 让我重现脑海中的那些画面。

如果觉得做的不错,欢迎点赞+转发,感谢各位看官
💻 Meta AI 推出了编程利器Code Llama

基于强大的 Llama 2 大型语言模型,它专门用于生成和讨论代码。在 Meta 官方测试中, Code Llama 模型在 HumanEval 和 MBPP 上的表现均优于最先进的开放式编码工具。现已正式公开,可供研究和商业使用。https://ai.meta.com/blog/code-llama-large-language-model-coding/

这是对人人成为 Builder 时代一次神助攻;现在,你就可以在 Perplexity 上免费体验 。
🔗 https://labs.perplexity.ai/?utm_content=first_codellama&s=u&utm_source=twitter&utm_campaign=labs

Invalid media: video
给产品经理一个大框架来写说明:)
---
# Role: 产品需求规格说明书设计专家

## Background:擅长根据用户输入的用户场景,进行产品需求规划说明书撰写。

## Attention:说明书简洁、明了,定义和业务流程清晰。让开发、测试和设计师等相关人员可以快速读懂。

## Profile:
- Author: gaya
- Version: 1.1
- Language: 中文
- Description: 我是一名产品需求规格说明书设计专家,擅长将复杂的产品需求转化为结构化、详尽的规格说明书,为开发团队提供清晰的指导。

## Skills:
- 精通产品规划和设计流程,能够理解并转化不同领域的需求。
- 具备编写详细文档的能力,能够将抽象的概念转化为具体的规格说明。
- 擅长设计清晰的Prompt,引导模型生成贴合需求的文档内容。
- 能够根据业务特点设计不同类型的需求规划说明书。

## Goals:
通过用户输入的用户故事,设计一个结构清晰、逻辑严密的需求规格说明书框架,确保引导AI模型生成符合业务需求的高质量文档。确保生成完文档内容后再结束。

## Constrains:
1. 您需要确保所有生成的内容符合产品规划和设计的最佳实践。
2. 请严格遵守角色设定,不要脱离角色特点进行讨论。
3. 请勿提供虚假信息,保持角色的真实性。

## Workflows:
1. 首先用户需要输入两个维度信息:
- 1)按“产品定位:[], 产品背景:[]”格式;
- 2) 再让用户按“角色1:[],故事1:[],优先级1:[];角色2:[],故事2:[],优先级2:[];...”方式,输入所有用户故事;
3. 根据以上用户输入的产品定位、背景、故事,进行功能性和非功能性需求拆解,拆解过程要求需求尽量细化,并确定优先级,符合行业实际;
4. 对用户故事有不清晰的地方,可以咨询我,让我提供更多的资料;
5. 最后输出符合用户故事所在行业的高质量产品需求说明书,包括以下内容模块:
- 1 产品定位和背景:简要介绍产品的目标、定位和背景。
- 2 目标受众:描述产品的预期用户群体。
- 3 功能需求:
- 1)功能列表:详细列出产品的所有主要功能和子功能。
- 2)功能描述:对每个功能进行详细说明,包括用户如何使用,所需输入和预期输出。
- 3)用例示例:提供针对不同用户场景的使用示例,以更好地理解功能的应用。
- 4 非功能需求:
- 1)性能要求:描述产品的性能指标,如响应时间、加载速度等。
- 2)安全需求:说明产品的安全性要求和措施。
- 3)可用性需求:规定产品易用性和可访问性的要求。
- 4)兼容性需求:描述产品与不同平台、浏览器或设备的兼容性。
- 5)可维护性需求:提出产品需要易于维护和扩展的要求。
- 5 界面设计:
- 1)用户界面:陈述产品的用户界面布局、元素和交互方式。
- 2)界面原型:提供初步的界面原型图,以便开发人员理解设计方向。
- 6 数据需求:
- 1)数据库结构:描述产品所需的数据存储和数据库结构。
- 2)数据流程:说明数据在系统内部和外部的流动方式。
- 7 验收标准:产品验收:确定如何判断产品是否符合需求,包括功能测试和性能测试等标准。
- 8 风险与限制:
- 1)风险分析:列出可能的风险和问题,并提出应对策略。
- 2)技术限制:描述产品开发可能遇到的技术限制或挑战。请按以上内容,进行补充!
## Suggestions:
- 设计详尽需求的建议:
1. 使用明确的表达,确保文档中的需求清晰易懂。
2. 列举具体的功能点和交互细节,避免遗漏关键内容。

- 引导模型关注场景的建议:
1. 在Prompt中描述产品使用场景,帮助模型理解需求背景。
2. 引导模型考虑用户在不同场景下的使用体验。

- 设定优先级的建议:
1. 详细说明各需求之间的优先级关系,帮助模型生成有条理的文档。
2. 引导模型考虑功能的重要性和实现难度,设定合理的优先级。

- 结合业务需求的建议:
1. 根据不同业务需求,设计具体领域的规格说明书,确保生成的内容满足实际要求。
2. 引导模型考虑用户特点,提供适合业务的解决方案。

- 编写清晰描述的建议:
1. 使用准确的语言,避免歧义和模糊表达。
2. 引导模型生成详细的描述,确保开发团队理解需求细节。

## Initialization:
作为角色,遵守,参考和您需要遵循制定的规则,使用指定的语言与用户进行交流,并以友好的方式引导用户。接下来,介绍自己,告诉用户。
只要上传一张照片就能被“X光”,扒各种隐私,有点细思极恐🤯

PimEyes:一款面部识别搜索引擎和反向图像搜索工具

PimEyes可以通过互联网搜索包含指定面部的图片,并使用面部识别搜索技术进行反向图像搜索。

通过PimEyes,您可以找到面部并查看图片在互联网上的出现位置,帮助您保护隐私。这是一种很好的工具来审查版权侵权行为。

您可以上传照片进行搜索,并成为订阅用户以查看发布您照片的网站来源。

PimEyes还提供定价方案,让您访问搜索结果、设置警报以监控在线存在、以及永久删除外部网站上的照片。

PimEyes使用最新的技术,如人工智能和机器学习,帮助您在互联网上找到自己的图片,并保护您免受骗子、身份盗窃者或非法使用您照片的人伤害。

PimEyes是一个多功能工具,让您追踪互联网上的面部、维护图片权益并监控您的在线存在。

通过PimEyes的面部识别搜索引擎,可以发现您的面部在互联网上的出现位置。

🔗 https://pimeyes.com/en
今天在Producthunt发现一个AI模型Kombai可以理解Figma的界面设计并生成对应的前端代码,下面是他们官网的演示视频。
从演示来看生成的代码还是不错的,它的优势在于他不要求设计稿的格式、层级和是否使用组件,无论你怎么嵌套和画出的界面它都能理解。
这比之前通过传统工程化思路从设计稿生成代码要强多了。之前的一些工具要不是处理不了复杂样式,要不就是对设计师的设计稿格式有非常严格的要求。
同时这个模型也支持通过自然语言生成前端界面的代码。

官网链接:https://kombai.com/
个人AI工具怎么选
有网络条件的
1、大模型选ChatGPT和Claude
ChatGPT:https://chat.openai.com/
Claude:https://claude.ai/
教程:https://hf0y97ff1r.feishu.cn/wiki/wikcny12P81C1iUyPJe0s1IsqJg
2、AI绘画选 Midjourney
Midjourney:https://www.midjourney.com/
教程:https://hf0y97ff1r.feishu.cn/wiki/LK3lwZwcqivjIEkzAvDcoZq9nXd
3、集成AI工具的选Poe
Poe:https://poe.com/
帮助文档:https://help.poe.com/

没有网络条件的
4、AI绘画有硬件条件的选本地部署 Stable Diffusion,没有硬件条件的选云部署
教程:https://hf0y97ff1r.feishu.cn/wiki/T0UrwFZUpicPu2k2hzecz9WhnRd
5、国产的大模型选文心一言和讯飞星火
文心一言:https://yiyan.baidu.com
讯飞星火:https://xinghuo.xfyun.cn/
6、办公需求选WPS AI
WPS AI:https://ai.wps.cn/
#AI的神奇用法 #AI工作流
AI探索指南
对话杨植麟:Moonshot AI即将完成超10亿元融资,公司最终目标并非超越OpenAI 最近读到的LLM相关的文章,个人感觉质量最高的是这两篇: 1. 马丁:大模型赛道的技术和应用分析 https://whjlnspmd6.feishu.cn/wiki/DBnWwik1piTB6Iki02CcXoVQn3S 从技术测的预训练、Alignment(SFT / RLHF)、评测、MOE,到团队组织,到创业环境,再到应用层可能的机会(2C/2B),非常系统地给出了LLM现状的一个综述。尽管其中有不少都…
https://mp.weixin.qq.com/s/mvBzhNmM-skPmxrXIpxUlQ

内容同样很干,个人觉得很有启发的一些观点摘抄:

- 行业大模型的计算量本质上是一个能源转化成智能的过程。如果我投入了更多的能源,我就会有更多的智能,中间转化率取决于我的算法的有效性。如果我假设你算法是一样的,那么你有多少智能就完全取决于你有多少能源... 通用模型一定会取代垂直行业模型,因为前者的能耗大好几个数量级,对应的智能也会高几个数量级,并且差距会越来越大。短期内,垂直行业模型在一些封闭的行业内会有专有数据优势,但因为数据的流动性很高,“再封闭的行业,都很难阻止数据的扩散,超级入口会变成数据黑洞把各种数据吸纳进来,行业模型的优势会消失。”

- 如何衡量算法的有效性?最重要的标准其实是模型的压缩比。如果基于第一性原则来思考,智能的首要任务就是优化压缩,那么提升压缩比就意味着智能的增强。在一个足够大的数据集上,模型的压缩比有多大就能衡量出模型的优劣。例如,OpenAI的GPT-4可能在某些领域已经达到了30多的压缩比,而一些开源的模型的压缩比可能只有10出头,所以空间还是非常大的。

- 技术三段论。每项技术基本都会历经原理探索期、技术创新期以及纯产品应用阶段三个阶段。第一阶段意味着公众对于技术的第一性原理还不清晰,一切刚刚开始萌芽;第二阶段则指的是第一性原理已经清晰,但是仍然存在技术创新的空间,领先的公司会有显著的技术优势;最后一个阶段,当技术已经足够成熟了,可获得性很高了,就是纯产品的机会,网络效应建立。两三年前,NLP、CV这些技术都处于第一阶段。如今,我们已经来到第二阶段,AI的第一性原理已经被大量证据所证明——从GPT1到GPT4,我们会发现,人类文明的总和,数字化之后都可以变成硬盘上的数据,无论是文字、语音还是视频,只要我们有合适的办法,去对这些数据做最大限度的规模化无损压缩,就能实现非常高程度的“智能”。这就是AI的第一性原理。在第二阶段,第一性原理已经清晰的情况下,理论上我们只需要一条道走到黑,去想更好的办法尽可能地去对整个人类文明进行压缩,然后就能在技术上实现较高程度的智能化。我最喜欢的例子是等差数列。假设说目前我有1万个数字要去压缩,在我一无所知的情况下,我所能做的仅仅只是把这1万个数字存下来。但是,如果我能够知道这些数的底层运行规律,我知道等差数列,那我就只需要存两个数字,其他9998个数字就能被还原出来。而“更好的办法”也是第二阶段与第三阶段的分野。在这个方向上,我们看到大约5年的窗口期之中,我们需要去解决目前看到的问题,不断技术创新,让技术变得更加通用和低门槛,最终推动大规模的产品化。在这个阶段,更好的模型质量通常会直接带来更好的用户体验,通过技术驱动的公司会拥有更大的产品优势。如果我们去看美国市场,目前领先的公司例如OpenAI, Anthropic, Inflection, Character AI, Midjourney,无一不是通过Model as an application的方式,通过技术优势来形成产品上的体验优势。

- 如果时间足够长,Transformer肯定会被更好的模型替代。比如,如果你想处理10万的context,你肯定不能使用原始的Transformer。如果你想处理分钟级别的长视频,使用原始的Transformer可能不是最优方案。但在短期三到五年内,更大的可能性是在Transformer的核心思想上进行优化。

- 真正的多模态模型还未出现。基于Diffusion Model的技术路径,一个重大问题是你没有办法去做真正的跨模态建模,只能基于很简单的文本向量去做decoding。本质上,它并没有对不同模态的联合概率去做一个可规模化的建模,这制约着这些模型去发挥更大的价值。从可规模化这个点上,我个人认为,长期来看,可能Autoregressive model(自回归模型)能够更通用得对不同模态去建模,长期会有更大的上升空间。

- 如何超越现有数据的限制。未来的大模型肯定不会停留在压缩现有的数据,而是会自主进行探索、在探索过程中生成和筛选数据、并进行压缩。一个很典型的例子是围棋,如果AI通过压缩已有的棋谱,很难在围棋水平上超越最顶尖的人类棋手。相同地,如果是我们想训练一个能达到IOI金牌水平的编程AI,那么仅仅通过压缩现有的题解也是很难做到的。我们需要让编程AI自己去搜索不同的解法,在搜索的过程中评判解法的可行性,从而对解空间进行更全面的探索。在科学领域也是一样,如果AI可以自主探索解空间,那么就可以发现人类还未发现的新知识。长期来说,通用地解决这个问题会产生超级智能(super intelligence)。

- 最终,大模型团队比拼的是人才密度。人才的稀缺性大于资本的稀缺性。目前,人才正开始从细分的NLP、CV、RL等领域向大模型公司集中。对团队来说,最难的是算法创新和工程实现。工程实现能力决定了你技术能力的下限,而算法创新能力决定了技术上限。
对话杨植麟:Moonshot AI即将完成超10亿元融资,公司最终目标并非超越OpenAI

最近读到的LLM相关的文章,个人感觉质量最高的是这两篇:

1. 马丁:大模型赛道的技术和应用分析
https://whjlnspmd6.feishu.cn/wiki/DBnWwik1piTB6Iki02CcXoVQn3S

从技术测的预训练、Alignment(SFT / RLHF)、评测、MOE,到团队组织,到创业环境,再到应用层可能的机会(2C/2B),非常系统地给出了LLM现状的一个综述。尽管其中有不少都是opinions,但这些opinions是经过深度思考和前沿交流之后沉淀下来的,非常干,值得关注。

对个人启发比较大的几个点:

- 目前制约大模型能力接近GPT4的主要因素不是knowhow(正在迅速贬值),而是如何在算力有限的情况下更快地试错。这样看来,随着中美算力的差距越来越大,模型能力的差距可能正在拉大而不是缩小。这可以通过即将发布的Google Gemini能否大幅超越GPT4来验证。

- 在预训练中,大家过于关注算力,对数据规模、数据质量、数据管理、数据配比、数据清洗、scaling up(做小规模的精准验证)的关注不够。MOE尤其考验数据和Infra能力;

- 尚未证明RLHF一定比SFT更好,更难倒是真的;

- 9月是大模型创业公司下场的最后期限,之后就太晚了。投资人之后会更关注Infra和应用方向。好团队的标准:技术实力(工程能力而不是学术能力)+ 行业资源knowhow( + 政府资源额外加分);

- Infra层面上,未来需要一个足够强的未做过alignment的foundation model,在此基础上提供加训、自定义对齐、评测、部署等更加精细的服务,而不是像现在这样只是简单地调用各个大模型的API;

- 向量数据库解决的是匹配外部知识的问题,它既不是唯一解,也不是最优解,甚至不如一些传统的搜索和NLP算法。如果是引入外部知识,那么更好的方法是pretrain或continued pretrain;

- 在国内,相对于2B,更看好2C,但character.ai之类的chatbot窗口期已过。

2. 对话杨植麟:Moonshot AI即将完成超10亿元融资,公司最终目标并非超越OpenAI
我有一个想法,让AI生成这样的图片,然后真人布景去拍摄。
今年,是人形机器人的“iPhone时刻”吗? | 【经纬低调研究】

人形机器人变火的原因是,今年智能/泛化能力大幅加强,让通用机器人成为可能。以前机器人行业之所以迭代很慢,是因为每学一套新动作,就需要重新编程一次。而现在有了智能泛化能力的突破,只需要语音控制,机器人就能实现功能,这是一种底层转变,通用性更强、应用场景更多
听到一个有趣的说法,割草机器人不好卖是因为很多美国人喜欢割草,解压
视频版Midjourney
1、无限次免费图片转视频
2、在discord就可用
3、支持文生视频和图生视频
4、操作非常简单,和midjourney操作基本一致
🔍使用教程:
搜索pikalabs ➡️点击join the beta➡️来到discord➡️斜杠/唤起create即可输入文字prompt,点击增加1可以上传图片,根据图片生视频
Back to Top