关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
🧪Midjourney V6 每天都能给我新惊喜,一个玉石雕刻的国风场景,由于细节很丰富,看起来真的像工艺品。

昨天在小红书看到一个玉雕的图,但是作者没写提示词,今天复刻了一下,效果还好了很多。
主要是 V6 对提示词的理解太好了,之前一些可有可无的词真的不太影响效果画面描述准确就行。#晚安提示词

提示词:
miniature landscape, jade sculpture, mountains, a chinese ancient architecture are in between a cloud, in the style of gold and jade, photorealistic details,Very good light transmittance, miniature sculptures, made of jade, gold and emerald, uhd image, Epic, octane render, beautifully detailed, light diffusion, cinematic shading, cinematic elements --ar 3:4 --v 6.0
最近研究 AI 渗透和使用时,发现人们正在尝试有趣的 ChatGPT 新用法:

「女孩们正在导出她们的WhatsApp消息,并带它们去ChatGPT进行关系分析」

🫡

#AI的神奇用法
Openart 整的这个 Comfyui 基础流程合集不错啊,这个合集里面基本只有各个模块最基本的实现,而且尽量使用原始节点。
非常适合学习和入门 Comfyui,把这些吃透了基本也就可以自己搭建工作流了。而且也可以大概看懂其他人的工作流,不怕瞎改了。

合集地址:https://openart.ai/workflows/templates
接了个GLG的电话访谈,
聊了不到10分钟给我挂了……
不开心,必须记录下!

对方要写报告,写一份AIGC--创意平台未来可能的市场空间/规模的预估报告……
对方希望撰写的方式是看各个内容板块的行业规模,考量AI的渗透率,再加总;
比如长视频-长视频生产成本-AI解决哪些环节--替代多少人力和提升效率;
游戏多少、短视频多少、直播多少、游戏多少等等。

我说:
1、这种从需求端倒推的方式可能对于目前阶段的AIGC行业而言是不太合适的,因为还太早了,很多所谓的乘数现在哪怕是拍脑袋都没办法拍;(生产环节有哪些可以用AI,多大程度用AI,是不是未来会有新的环节产生,以及产业规模因此的放大乘数等等)

2、相对合理一点点的,可以有一定验证逻辑的应该是从供给端拆,就是这一波大模型在各个多模态领域(文字、图片、3D素材、视频、音乐等)的进展,先给一些偏感性的阶段划分(还在找最优技术路线、已经到了GPT时刻、开始进入生产管线等),然后再根据这个节奏和阶段往后推一点点;
(如图)

3、如果非要写在这个报告,最后你只能拍大框,非常大的框架,就不能往细分环节上抠,因为不可能抠出来。

对方听完,电话里说:
哎,我想开了,我放弃了,不TM写了……

然后就给我挂了……
留下我在风中默默哭泣……
这TM10分钟的钱,
还不够我吃碗拉面呢,
艹~~~~
这个工具有点牛逼,让gpt4生成图片,gpt4直接调用mj
机器未来3-5年智能化所需的能力

模拟:模型能加速模拟环境开发,连接3D开发人员,构建场景、环境,生成资产。这些GenAI资产能广泛应用于合成数据生成、机器人技能训练和软件测试;
多模态大模型接入:基于Transformer的模型能帮助机器人更好地理解周围世界,让它们可以在更多环境中工作,完成复杂任务。
机器人(重新)编程:能更简单地用简单语言定义任务和功能,让机器人更加通用和多用途,通用机器人永远要和场景适配
执行:为了提高效率,结合新颖的机械设计,比如末端执行器\灵巧手(目前成本比较高可控性还不够)提升使用工具的能力
#AI #机器人
Gemini Pro + 自定义 prompt = 更沉浸的沉浸式翻译。

浏览器自带的全文翻译效果,读起来像吃了苍蝇一样。除了机翻感和没有原文对照之外,主要原因还在于很多词汇的翻译不准确,或者说在当前的上下文里不准确,导致读起来有些莫名其妙。

沉浸式翻译插件把网页翻译的阅读体验推到了一个新的高度。根据当前网页结构,巧妙地在原文段落后面显示翻译结果。这样在读的时候,就有原文可以对照了。很沉浸。

昨天在用的时候,发现已经支持 Gemini 作为翻译引擎了。看了一下,还支持自定义翻译 prompt, 我想这正好可以用来解决有些词汇翻译不准确的问题。

于是,顺手申请了一个 Gemini 的 Key, 然后咔咔写了一段 prompt.

图一可以看到,默认用 Google Translate 翻译的话,LLM 经常会被翻译为法学硕士。图二是使用 Gemini + 自定义 prompt 之后的效果。

Prompt 也很简单,主要就是根据自己经常读的文章类型,做一个词汇翻译对照表,让 Gemini 按照这个对照表翻译。

参考 prompt (可能需要替换成你自己的词汇表):
https://docs.qq.com/doc/DSUJ0bGppUlJ6aHJZ

沉浸式翻译浏览器插件:
https://immersivetranslate.com

Gemini API Key 申请步骤(免费):
https://immersivetranslate.com/docs/services/gemini/

参考图三、图四,分别在插件设置页面里填写 Gemini Key 和 prompt 即可。
圣诞连着三天,写脚本+作图+导出视频+剪辑,用Midjourney+runway+elevenlabs生成,做出来一个开脑洞的耶稣与佛陀穿越相遇的视频。

祝大家圣诞快乐!🧑‍🎄

Invalid media: video
全人类的体力很接近,无论博尔特还是黄渤,跑百米都只有几秒钟差距(只要不是老幼病残)反正都不如飞机汽车
人类的智力其实也很接近,无论北大毕业还是小学辍学,不靠专门数数都无法一眼认清一把豆子的数量,能一眼认清的上限也就是6-7颗。算力反正都不如计算机
我们喜欢夸大人与人的差距,是因为构建阶级秩序要从任何细微的差异里争个高下。实际上180cm巨人的身高也只是170cm残废的1.05倍而已
但寻求生产力革新,需要我们跳出这种视野束缚,哪怕快如博尔特,也仍然需要汽车

你做数学题时,可以轻易算出1133x3355等于几,但你跟人聊天时,就无法随口说出答案
你乘飞机可以日行万里,但博尔特跑步也只能在地图蠕动,有辆车就很方便
我们也不会因为汽车速度不如飞机,就觉得飞机是更高频killer场景。所以,要多去寻找在人需要随口表达的场合提供小学数学级别的辅助,而不是端正做高数题时的科学家级辅助

你可能忽视这个问题,是因为你以为人脑具有完全思考算力。但你现在遇到一首歌难听,你甚至都无法用顺畅逻辑分析出它为什么难听。
因为人类的脑原理决定了,哪怕科学家,日常也只能在少数时间调用复杂逻辑运算,大部分时候仍只能用直觉来面对生活,无非是直觉里的训练集比别人多一点而已
(语音转文字发表,可能条理有点乱)
用手柄控制人脸表情,什么赛博肉体飞升控制论……😂

{ROS-Face是一个利用ROS游戏手柄系统操控人类面部肌肉,从而控制面部表情的项目。}

链接:https//github.com/maHidaka/ros_face/tree/master

- 😯 反常识观点:ROS-Face项目使得人脸表情可以像操控机器人一样被控制,这打破了传统认为面部表情只能自然形成的观念。
Back to Top