关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
最近研究 AI 渗透和使用时,发现人们正在尝试有趣的 ChatGPT 新用法:

「女孩们正在导出她们的WhatsApp消息,并带它们去ChatGPT进行关系分析」

🫡

#AI的神奇用法
Openart 整的这个 Comfyui 基础流程合集不错啊,这个合集里面基本只有各个模块最基本的实现,而且尽量使用原始节点。
非常适合学习和入门 Comfyui,把这些吃透了基本也就可以自己搭建工作流了。而且也可以大概看懂其他人的工作流,不怕瞎改了。

合集地址:https://openart.ai/workflows/templates
接了个GLG的电话访谈,
聊了不到10分钟给我挂了……
不开心,必须记录下!

对方要写报告,写一份AIGC--创意平台未来可能的市场空间/规模的预估报告……
对方希望撰写的方式是看各个内容板块的行业规模,考量AI的渗透率,再加总;
比如长视频-长视频生产成本-AI解决哪些环节--替代多少人力和提升效率;
游戏多少、短视频多少、直播多少、游戏多少等等。

我说:
1、这种从需求端倒推的方式可能对于目前阶段的AIGC行业而言是不太合适的,因为还太早了,很多所谓的乘数现在哪怕是拍脑袋都没办法拍;(生产环节有哪些可以用AI,多大程度用AI,是不是未来会有新的环节产生,以及产业规模因此的放大乘数等等)

2、相对合理一点点的,可以有一定验证逻辑的应该是从供给端拆,就是这一波大模型在各个多模态领域(文字、图片、3D素材、视频、音乐等)的进展,先给一些偏感性的阶段划分(还在找最优技术路线、已经到了GPT时刻、开始进入生产管线等),然后再根据这个节奏和阶段往后推一点点;
(如图)

3、如果非要写在这个报告,最后你只能拍大框,非常大的框架,就不能往细分环节上抠,因为不可能抠出来。

对方听完,电话里说:
哎,我想开了,我放弃了,不TM写了……

然后就给我挂了……
留下我在风中默默哭泣……
这TM10分钟的钱,
还不够我吃碗拉面呢,
艹~~~~
这个工具有点牛逼,让gpt4生成图片,gpt4直接调用mj
机器未来3-5年智能化所需的能力

模拟:模型能加速模拟环境开发,连接3D开发人员,构建场景、环境,生成资产。这些GenAI资产能广泛应用于合成数据生成、机器人技能训练和软件测试;
多模态大模型接入:基于Transformer的模型能帮助机器人更好地理解周围世界,让它们可以在更多环境中工作,完成复杂任务。
机器人(重新)编程:能更简单地用简单语言定义任务和功能,让机器人更加通用和多用途,通用机器人永远要和场景适配
执行:为了提高效率,结合新颖的机械设计,比如末端执行器\灵巧手(目前成本比较高可控性还不够)提升使用工具的能力
#AI #机器人
Gemini Pro + 自定义 prompt = 更沉浸的沉浸式翻译。

浏览器自带的全文翻译效果,读起来像吃了苍蝇一样。除了机翻感和没有原文对照之外,主要原因还在于很多词汇的翻译不准确,或者说在当前的上下文里不准确,导致读起来有些莫名其妙。

沉浸式翻译插件把网页翻译的阅读体验推到了一个新的高度。根据当前网页结构,巧妙地在原文段落后面显示翻译结果。这样在读的时候,就有原文可以对照了。很沉浸。

昨天在用的时候,发现已经支持 Gemini 作为翻译引擎了。看了一下,还支持自定义翻译 prompt, 我想这正好可以用来解决有些词汇翻译不准确的问题。

于是,顺手申请了一个 Gemini 的 Key, 然后咔咔写了一段 prompt.

图一可以看到,默认用 Google Translate 翻译的话,LLM 经常会被翻译为法学硕士。图二是使用 Gemini + 自定义 prompt 之后的效果。

Prompt 也很简单,主要就是根据自己经常读的文章类型,做一个词汇翻译对照表,让 Gemini 按照这个对照表翻译。

参考 prompt (可能需要替换成你自己的词汇表):
https://docs.qq.com/doc/DSUJ0bGppUlJ6aHJZ

沉浸式翻译浏览器插件:
https://immersivetranslate.com

Gemini API Key 申请步骤(免费):
https://immersivetranslate.com/docs/services/gemini/

参考图三、图四,分别在插件设置页面里填写 Gemini Key 和 prompt 即可。
圣诞连着三天,写脚本+作图+导出视频+剪辑,用Midjourney+runway+elevenlabs生成,做出来一个开脑洞的耶稣与佛陀穿越相遇的视频。

祝大家圣诞快乐!🧑‍🎄

Invalid media: video
全人类的体力很接近,无论博尔特还是黄渤,跑百米都只有几秒钟差距(只要不是老幼病残)反正都不如飞机汽车
人类的智力其实也很接近,无论北大毕业还是小学辍学,不靠专门数数都无法一眼认清一把豆子的数量,能一眼认清的上限也就是6-7颗。算力反正都不如计算机
我们喜欢夸大人与人的差距,是因为构建阶级秩序要从任何细微的差异里争个高下。实际上180cm巨人的身高也只是170cm残废的1.05倍而已
但寻求生产力革新,需要我们跳出这种视野束缚,哪怕快如博尔特,也仍然需要汽车

你做数学题时,可以轻易算出1133x3355等于几,但你跟人聊天时,就无法随口说出答案
你乘飞机可以日行万里,但博尔特跑步也只能在地图蠕动,有辆车就很方便
我们也不会因为汽车速度不如飞机,就觉得飞机是更高频killer场景。所以,要多去寻找在人需要随口表达的场合提供小学数学级别的辅助,而不是端正做高数题时的科学家级辅助

你可能忽视这个问题,是因为你以为人脑具有完全思考算力。但你现在遇到一首歌难听,你甚至都无法用顺畅逻辑分析出它为什么难听。
因为人类的脑原理决定了,哪怕科学家,日常也只能在少数时间调用复杂逻辑运算,大部分时候仍只能用直觉来面对生活,无非是直觉里的训练集比别人多一点而已
(语音转文字发表,可能条理有点乱)
用手柄控制人脸表情,什么赛博肉体飞升控制论……😂

{ROS-Face是一个利用ROS游戏手柄系统操控人类面部肌肉,从而控制面部表情的项目。}

链接:https//github.com/maHidaka/ros_face/tree/master

- 😯 反常识观点:ROS-Face项目使得人脸表情可以像操控机器人一样被控制,这打破了传统认为面部表情只能自然形成的观念。
求问:
互联网上或者你自己,有看到用AIGC或者AI工具,做出来像样的项目或者作品了吗?
或者是切实的解决了工作中、生活中的痛点,解放了生产力?
我司AI真的甩某🦆一百条街
🧪来了,昨天很多人问我那个国风CG的提示词,所以整理了一下,那套风景的挺简单的。我还顺便用这套词的图做了一个黑神话·悟空音乐《戒网》的MV,感觉风格超级像,哈哈。

提示词的结构为:
[scenery],[season], [weather], [mood]::3, Chinese style, mist, natural lighting, Epic, realistic, octane render, beautifully detailed, light diffusion, cinematic shading, cinematic elements。

[]括号括起来的分别是景物,季节,天气还有气氛,这几个去掉一个或者两个也没问题有可能效果更好,就是抽卡。

举个例子:moon, river, autumn, wind, sad atmosphere::3 , Chinese style, mist, natural lighting, Epic, realistic, octane render, beautifully detailed, light diffusion, cinematic shading, cinematic elements --ar 16:9 --v 6.0

顺便介绍一下我和 @lyson_ober 一起做的提示词收集网站Catjourney 也同步更新了这些提示词,不再是只有风格词。

里面所有的提示词和图片都是我们人工挑选和生成的,绝对不会踩坑,没有货不对板的情况。下面放几张这套提示词生成的放大图片。

所有的提示词和图片都在这里:https://catjourney.life/

Invalid media: video
机器人商业化的唯一路径可能是“硬件刚性+软件柔性”,对应产品标准化和任务多样化/复杂化,由此ROI提高,渗透率提高。

这么看的话,AI+Robot和Robot+AI两种提法其实都不错。
卧槽,字节昨天发布这个项目DreamTuner,可以一举解决图像生成中角色一致性的问题。

效果也太好了,可以将输入图片的角色在生成新图是完美保留,并且融合度非常好,这下小说、漫画和视频的人物一致性和商品一致性问题彻底解决了。

并且可以和ContorlNet联动确保动画的稳定,间接实现了前段时间的让单张图片动起来的功能。

项目简介:
我们提出了一种新颖的方法DreamTurner,该方法将定制主题的参考信息从粗到细注入。首先提出了一个主题编码器,用于粗略主题身份保留,通过额外的注意力层在视觉-文本交叉注意力之前引入了压缩的一般主题特征。
然后,注意到预训练的文本到图像模型中的自注意力层自然地执行了详细的空间上下文关联功能,我们将其修改为自主题注意力层,以细化目标主题的细节,生成的图像从参考图像和自身查询详细特征。
值得强调的是,自主题注意力是一种优雅、有效且无需训练的方法,用于保持定制概念的详细特征,可在推断过程中作为即插即用的解决方案。
最后,通过对单个图像进行额外微调,DreamTurner 在受主题驱动的图像生成方面取得了显著的表现,可由文本或其他条件(如姿势)进行控制。

项目地址:https://dreamtuner-diffusion.github.io/
Back to Top