关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
去年被 Google 收购的一家创业公司 Socratic (移动学习教育 APP),创始人 Shreyans 有一篇文章,总结了她从这次收购中看到了、学到了什么。

去年读的时候感觉挺平常的,今天重读一遍发现有一些点还是很深刻的,比如大公司对于创业公司的看法是什么、什么情况才会注意到创业公司、大公司相比于创业公司的优劣势等。

1)Google does things the Google way, 谷歌以谷歌的方式做事

谷歌使用的几乎每一款软件和基础设施都是在谷歌构建的,这是比大多数公司更早面对最棘手的工程问题下的自然结果。

这意味着我们无法保留我们自己的代码库,必须从头开始,在谷歌的技术栈上重建我们的应用程序,与新团队一起重建产品。

2)简单的事情反复完成会让人感到不可思议

我注意到的一个模式是,伟大的 AI 研究人员愿意手动检查大量数据。不仅如此,他们还构建了基础设施,使他们能够快速手动检查数据。虽然并不光彩,但手动检查数据可以提供有关问题的宝贵直觉。

3)大多数问题不值得谷歌花费时间

大多数用户规模在 1000 万至 5000 万之间的问题并不值得谷歌花费时间,而且不符合他们的战略。但对于符合他们性质、战略以及某人的晋升目标的问题,他们将投入大量精力。

4)谷歌员工渴望交付出色的工作,但往往无法做到

虽然毫无疑问,有一些人是冲着美食而来,每天只工作 3 小时,享受着提前退休的生活,但我所遇到的所有人都是认真、努力工作,并希望能够做出优秀的工作。

打败渴望出色的员工的是审查的重重关卡、频繁的组织重组、过去失败留下的制度疤痕,以及在国际舞台上做一些简单事情的复杂性。初创公司可以忽略许多问题,但谷歌员工很难做到这一点。

另一个阻碍他们的是他们自己。所有聪明的人都能反驳任何事情,但却不能支持某件事情。所有的领导者缺乏说出令人不适的真相的勇气,以及所有被雇佣却没有明确项目可供工作的人,但仍必须通过虚构的工作来保留其晋升资格。

5)头重脚轻、结构庞大的组织很难调整方向

我亲身经历的另一个阻碍进展的因素是组织结构的顶层过重。一个团队拥有多位成功的联合创始人和 10~20 年的谷歌老兵听起来可能是取得伟大成就的秘诀,但这也是制造僵局的秘诀。

如果有多个领域可以探索,明确的目标以及强大的自主权来追求这些路径,这种结构可能有效。但如果你想要致力于一个统一的产品,它需要一个明确的领导者,一个明确的方向,以及更多的实干者而非思考者。与直觉相反,在早期项目中增加更多人并不能使项目进展得更快。

6)在谷歌,只要你玩对了游戏,惊喜的事情就是可能的

谷歌曾经有一套他们称之为“三尊重”的内部价值观:尊重用户,尊重彼此,尊重机遇。

前两者比较容易理解,但第三者却让大多数人感到困惑。我的理解是:你在谷歌,这是一个极其盈利、充满天才的企业。你薪水丰厚,食物丰盛,生活在永恒的春天天堂——硅谷。

所以,拥有这种疯狂的运气,你能做的最好的事情是什么呢?
Perplexity的热点推送做得真不错,可以自动整理对应热点信息的所有内容,给出完整的事件经过和背景。还有引用来源。#ai#
比如Andrej Karpathy 离职这个事情,还有一个就是你可以直接让他把整理的内容翻译成中文,非常方便。

专题链接在这里:网页链接
Andrej Karpathy 关于自己从 Open AI离职的声明:

大家好,确实,我昨天刚刚离开了OpenAI。首先要说的是,这并非因为发生了什么特别的事件或问题,也不涉及任何戏剧性的变故(不过,大家继续提出的各种阴谋论还是挺有趣的:))。其实,过去大约一年在OpenAI的经历非常棒——团队实力强大,同事们非常棒,而且OpenAI的发展规划也极具吸引力,我相信我们都有很多值得期待的事情。目前,我打算专注于我的个人项目,看看能碰到什么新奇的事。那些一直关注我的朋友,可能对我接下来会做什么已经有所预期了;) 再会
进行一个迎财神!
各位情人节加大年初五快乐啊,不过貌似都在迎财神没人管情人。#ai#

跟朋友们做了个情人节小项目,输入图片和想说的话可以生成一张花朵的拍立得照片。

感兴趣可以玩玩。如果觉得不错可以介绍给朋友们试试,生成时间稍微有点长可以耐心等一会。

扫描图片二维码就可以参与。
试了一下Leiapix 这个可以提取图片深度信息,然后生成运镜视频的产品。

效果还挺好的,自定义选项也很丰富,一些简单的场景运镜视频不用视频生成工具用这个也挺好。

直接上传图片然后再右侧调整选项就行。

这里尝试:https://www.leiapix.com/

Invalid media: video
Stable Cascade的模型已经正式放出了,A、B 、C 三个阶段的模型都在里面。#ai画图#

模型页面也有一些新的图片,看起来效果确实比 SDXL 要好一些,尤其是文字部分。

在这里下载:网页链接
尝试了一下Stable Cascade,可能是 Demo 的资源问题,现在生成的图片细节非常的差,基本没有纹理,和介绍页面的差距较大。#ai画图#

提示词响应还可以,文字生成真的不错。

这里尝试:网页链接
KREA 发布了他们图像放大功能的 2.0 版本,从演示来看似乎跟 Magnific AI 不相上下了。#ai画图#

可以免费试用,但是需要排队,时长有点离谱,不过整体来看还是比Magnific AI便宜。

这里尝试:网页链接歸藏的AI工具箱的微博视频
Stability AI产量很高啊,推出了一个新的 AI 图像生成模型Stable Cascade,还会发布对应的微调、ControlNet 和 LoRA 训练的脚本。#ai画图#

这个模型基于Würstchen架构,可以显著降低模型训练的算力成本,比 SD2.1 的算力成本降低了 10 倍左右。另外推理速度会比现有的 SD 模型快一倍左右。

更多功能:

除了标准的文本到图像生成之外,Stable Cascade 还可以执行图像变化和图像到图像生成。

会跟随模型一起发布的 Controlnet:

局部重绘:输入与文本提示附带的蒙版配对的图像。该模型根据提供的文本提示填充图像的遮罩部分。

Canny Edge:通过跟踪输入到模型的现有图像的边缘来生成新图像。该测试也可以从草图进行扩展。

2x超分辨率:也可用于C阶段生成的潜在空间。

了解更多:网页链接
ComfyUI ProPost一个非常有意思的节点,可以为你生成的图片添加各种丰富的效果,比如胶片颗粒、暗角、模糊等等,帮助生成图片的质感获得极大的提升。#ai画图#

你还可以对这些效果组合使用,比如下面这张图。

支持的效果有:

胶片颗粒:它可以创建不同的噪声类型和图案,并且可用于创建各种胶片颗粒外观。

晕影效果:使屏幕边缘变暗。

径向模糊:让你模糊图像的边缘。

深度图模糊:允许根据深度图模糊图像。可以将其与现有的深度图节点结合使用。

应用 LUT 滤镜:允许将 3D LUT 应用到图像。目前它仅支持 CUBE 格式的 3D LUT。

项目地址:网页链接
试了一下Leiapix 这个可以提取图片深度信息,然后生成运镜视频的产品。#ai视频#

效果还挺好的,自定义选项也很丰富,一些简单的场景运镜视频不用视频生成工具用这个也挺好。

直接上传图片然后再右侧调整选项就行。

这里尝试:网页链接歸藏的AI工具箱的微博视频
Back to Top