关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
果然平时看着专业的大神讲到自己的领域就。。。

影视飓风这个英特尔的商单搞了个利用 SD生成分镜的项目。但是原理的部分讲的完全是GAN模型的原理,用的却是SD 扩散模型。里面还有很多不专业的部分比如定制模型其实就是找了些Lora,神经网络不是模型而是算法等。

视频地址:https://b23.tv/rQ5RNyR
看到 a16z 的 AI 赛道观察总结,认知进步,值得参考。

7点总结:
1. Agents 不再是一个包含AI陪伴的大主题,而只属于生产力工具。
2. 强调 voice-first,通过说话用户能分享更复杂的甚至未完成的想法。
3. 强调 in-flow,最好的应用节点在用户的原有工作流里。
4. AI 陪伴,会成为每个人日常生活的一部分,像游戏一样沉浸,像真实的关系一样会进化。
5. AI社交,AI陪伴是人与AI的交互,而AI社交是AI和人群在一个虚拟世界场里的交互。
6. AI创意,被划为单独的一类,并且细分了内容生成和内容编辑
7. 个人成长类,包括个人教育、生活健康、个人金融

「分类是个工具而不是现实」
不过这样分类确实能帮助理解。

更多信息可参考原文PPT
https://gamma.app/public/a16z-Consumer-Abundance-Agenda-ieotbnzbxj81biu?mode=doc
如果家有老人患有阿尔兹海默症,这个公益项目可能帮得上忙

在少数派会员社区看到有派友求助,求推荐阿尔兹海默症相关的设备,需要能准确定位、紧急通话,续航要尽可能的长。

作者在社区提问,是因为淘宝、京东搜了一圈感觉鱼龙混杂,不知道哪家靠谱。

经过几家联网 AI 问答、电商搜索、小红书笔记搜索,我确定了一个推荐他了解的方案「黄手环行动」。

这是一个由中国人口福利基金会和央视新闻联合发起的公益项目,家有 60 岁以上患认阿尔茨海默氏症(及其他脑部、认知类疾病)的老人、或 80 岁以上老人的,可免费申请「微信手环」或「定位黄手环」:
- 微信手环:家属联系方式存入二维码,老人若走失,路人可通过扫码联系家属
- 定位黄手环:在微信手环扫码查信息的基础上,额外加了带实时定位、紧急呼叫、安全围栏等功能,不过数量很紧缺、今年的似乎已经申满了

对了,这次的搜索过程中 @KimiChat 值得点赞,黄手环的行动就是从 Kimi 知道的,答案的帮助性超过了联网 GPT-4 和 Gemini(原 Bard)。

参考来源:
小红书用户菌菌懒洋洋的黄手环申请攻略 http://xhslink.com/8efhrB
小红书用户阿尔兹海默姥姥的黄手环行动介绍 http://xhslink.com/uvihrB
这个和 Ollama 搭配使用的Mac聊天界面看起来不错啊,这下 Ollama 更易用了。#ai#

Enchanted是一款开源的、与Ollama兼容的、适用于macOS/iOS/iPad的优雅聊天应用程序。它专为私有部署的模型如Llama 2、Mistral、Vicuna、Starling等设计,本质上是一个连接到自己的Ollama模型的ChatGPT应用界面。

项目地址:网页链接
Gemini 团队这效率挺高啊,每天都在发布更新,昨天主要减少了对人物图片生成的拒绝行为,开始推出日语和韩语版本的 Gemini。#ai#

1)降低拒绝率:我们对很多包含人物的图片的处理标准进行了放宽。Gemini 将从这些图片中提取文本并进行推理分析。

这将特别有助于处理包含屏幕截图的图片,这是移动用户非常常用的功能!

我们仍然不允许例如拍摄自拍并将其与健身运动员的照片合成这样的操作。绝无捷径。

2)移动端:我们已经开始在 Android(首先通过 Assistant 功能选择)和 iOS(通过 Google 应用)上推出 Gemini 的日语和韩语版本。这是继昨天开始的全球英语版本发布之后的扩展,预计几天内完成。
Open AI 昨天公布了几个他们封禁的跟国家相关的恶意使用者,其中中国两个、俄罗斯一个、朝鲜一个、伊朗一个。#ai#

成功干预了五个国家相关的恶意行动主体:两个与中国有关的行动主体,分别命名为“Charcoal Typhoon”和“Salmon Typhoon”;一个与伊朗有关的行动主体,称为“Crimson Sandstorm”;一个与朝鲜有关的行动主体,名为“Emerald Sleet”;以及一个与俄罗斯有关的行动主体,名为“Forest Blizzard”。这些行动主体相关的OpenAI账户已被关闭。

这些行动主体通常利用OpenAI服务来查询开源信息、进行翻译、寻找编程错误,以及执行基本的编程任务。

更多信息:网页链接
开源社区对Stable Cascade的支持非常迅速,不过现在使用Stable Cascade的成本还是有些高的,起码需要 12G 显存。#ai画图#

同时 Comfyui 官方会在本周六前支持Stable Cascade。

这里有其他人的测试图片,👇还有Stable Cascade的各种使用渠道。

一个使用Stable Cascade的ComfyUI 插件:网页链接

一个只需要 12G 显存就能运行Stable Cascade的 ComfyUI 插件:网页链接

一个 A1111 Web UI 上运行Stable Cascade的插件:网页链接
重新回到AI创业的牌桌上正好半年,期间打了3场黑客松,访谈了20+位命理师(客单价从¥99到¥5000不等),和100+位创业者和投资人交流过,迭代了三版产品。以下是我关于AI+玄学这件事情的底层认知,期待能有进一步的碰撞和交流:
《一位AI创业者的复盘——关于AI、玄学、宇宙与生命的思考》https://magvedvqsp.feishu.cn/docx/RKSWdoMrZoCbfnxmkyDc0Rz6nse

原文一万两千字,提供一个太长不看版的Summary👇🏻
「关于AI」
- 对于应用层创业者而言,最深的护城河来自于无法在预训练和SFT阶段被模型轻易内化的垂类行业知识,以及在RLHF阶段对齐不了的用户反馈信息
- LLM的概率模型本质决定了想要追求精确性或者任何令人感到“出彩”的效果,必须通过控制手段将概率分支进行“裁剪”
- 所有基于LLM的优秀的对话类产品,本质上是在构建一个能完成「特定对话目标」&「确定剧本」的Agent,即将对话场景进行封闭域的收敛
- 在C端对话类场景下,AI若想要提供专业服务而非擦边服务,核心是“信任关系”的建立

「关于玄学」
- 传统的“五术”(山、医、命、相、卜)中,最适合基于LLM进行开发的是「命」,即命理
- 高端命理服务(客单价¥1500+),比起心理咨询,其实更接近法律咨询
- 提升算命的准确度可以类比MoE架构,但一味的追求算命的准确性是徒劳的,算得过准甚至会造成“恐怖谷效应”
- 命理师并不是一个单一专家模型,而是一个Muti-Agent架构;算命之外的其它服务(心理咨询、情感咨询、职业咨询、创业咨询等),以及命理师自身的人生阅历,往往更为关键

「关于宇宙与生命」
- 无穷的本质是什么,机器能思考吗,宇宙是一台图灵机吗
- 图灵信念VS哥德尔信念;维特根斯坦与降临
- 为什么中国传统“术数”(奇门遁甲、四柱八字、六爻等),可以看似凭空获取额外的信息
- 宇宙并不在乎,若站在整体/无穷/无限大而言样样都是注定的,自由意志该何去何从
黑神话悟空今天发了龙年贺岁的短片,但是一点游戏画面没有比较可惜,刚好音乐又非常好听。

于是就着音乐用 AI 整个了 MV,借这个 MV 祝大家乾坤处处结人缘,大地逍遥游遍。

Midjourney+Runway+Pixverse+CapCut #ai视频##黑神话悟空#歸藏的AI工具箱的微博视频
Perplexity的热点推送做得真不错,可以自动整理对应热点信息的所有内容,给出完整的事件经过和背景。还有引用来源。

比如Andrej Karpathy 离职这个事情,还有一个就是你可以直接让他把整理的内容翻译成中文,非常方便。

专题链接在这里:https://www.perplexity.ai/search/Andrej-Karpathy-left-iRRPSPFZSCSC6nvrhCvtWg?s=c
去年被 Google 收购的一家创业公司 Socratic (移动学习教育 APP),创始人 Shreyans 有一篇文章,总结了她从这次收购中看到了、学到了什么。

去年读的时候感觉挺平常的,今天重读一遍发现有一些点还是很深刻的,比如大公司对于创业公司的看法是什么、什么情况才会注意到创业公司、大公司相比于创业公司的优劣势等。

1)Google does things the Google way, 谷歌以谷歌的方式做事

谷歌使用的几乎每一款软件和基础设施都是在谷歌构建的,这是比大多数公司更早面对最棘手的工程问题下的自然结果。

这意味着我们无法保留我们自己的代码库,必须从头开始,在谷歌的技术栈上重建我们的应用程序,与新团队一起重建产品。

2)简单的事情反复完成会让人感到不可思议

我注意到的一个模式是,伟大的 AI 研究人员愿意手动检查大量数据。不仅如此,他们还构建了基础设施,使他们能够快速手动检查数据。虽然并不光彩,但手动检查数据可以提供有关问题的宝贵直觉。

3)大多数问题不值得谷歌花费时间

大多数用户规模在 1000 万至 5000 万之间的问题并不值得谷歌花费时间,而且不符合他们的战略。但对于符合他们性质、战略以及某人的晋升目标的问题,他们将投入大量精力。

4)谷歌员工渴望交付出色的工作,但往往无法做到

虽然毫无疑问,有一些人是冲着美食而来,每天只工作 3 小时,享受着提前退休的生活,但我所遇到的所有人都是认真、努力工作,并希望能够做出优秀的工作。

打败渴望出色的员工的是审查的重重关卡、频繁的组织重组、过去失败留下的制度疤痕,以及在国际舞台上做一些简单事情的复杂性。初创公司可以忽略许多问题,但谷歌员工很难做到这一点。

另一个阻碍他们的是他们自己。所有聪明的人都能反驳任何事情,但却不能支持某件事情。所有的领导者缺乏说出令人不适的真相的勇气,以及所有被雇佣却没有明确项目可供工作的人,但仍必须通过虚构的工作来保留其晋升资格。

5)头重脚轻、结构庞大的组织很难调整方向

我亲身经历的另一个阻碍进展的因素是组织结构的顶层过重。一个团队拥有多位成功的联合创始人和 10~20 年的谷歌老兵听起来可能是取得伟大成就的秘诀,但这也是制造僵局的秘诀。

如果有多个领域可以探索,明确的目标以及强大的自主权来追求这些路径,这种结构可能有效。但如果你想要致力于一个统一的产品,它需要一个明确的领导者,一个明确的方向,以及更多的实干者而非思考者。与直觉相反,在早期项目中增加更多人并不能使项目进展得更快。

6)在谷歌,只要你玩对了游戏,惊喜的事情就是可能的

谷歌曾经有一套他们称之为“三尊重”的内部价值观:尊重用户,尊重彼此,尊重机遇。

前两者比较容易理解,但第三者却让大多数人感到困惑。我的理解是:你在谷歌,这是一个极其盈利、充满天才的企业。你薪水丰厚,食物丰盛,生活在永恒的春天天堂——硅谷。

所以,拥有这种疯狂的运气,你能做的最好的事情是什么呢?
Back to Top