关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AI探索指南
#Midjourney V6上线 一些反馈发现(单簧管总结): - 提示词长度现在是350+ - 您可以指定颜色和其他细节 - 你可以在画布上放置你想要的东西,如添加文本 - 您可以提示多个主题 - 你可以像ChatGPT一样和Midjourney聊天 - V6能够理解标点和语法的细微差别(即:熊猫吃、射、走) - 可以使用V6制作niji那样的漫画 - 可以通过描述图像来为其添加框架或边框 如何启用:在 /settings 下拉菜单中选择 V6,或在提示后输入 --v 6。 官方对V6 模型的新特性:…
5、改进的放大器

•分辨率提升:V6 提供了改进的放大器功能,可以将图像分辨率提高 2 倍。

•两种模式:提供了 ‘subtle’(微妙)和 ‘creative’(创意)两种模式,以适应不同的图像处理需求。

V6 的风格和提示:

1、提示方式的变化:V6 的提示方式与 V5 显著不同,用户需要重新学习如何进行提示。V6 提供了更细致的控制能力,用户可能需要更精确地描述他们想要的输出,以获得最佳结果。

2、对提示的敏感性:V6 对提示中的每个词汇都非常敏感。因此,应避免使用如“奖项获得者”、“4K”、“8K”这类可能被视为“垃圾”的词汇,因为它们可能不会提升结果质量,反而可能导致模型混淆。

用户应尽量明确和具体地描述他们想要的内容。例如,如果需要一个特定风格的图像,应直接说明这一点。

3、风格和美学:使用 --style raw 可获得更真实的图像。--stylize 的不同值会影响提示理解和美学效果。

使用 --style raw:为了获得更真实、更少主观色彩的图像,建议使用 --style raw 参数。这个设置倾向于生成更接近真实世界、更少艺术化处理的图像。

--stylize 参数的影响:低值:较低的 --stylize 值(默认为 100)可能会导致更好的提示理解,但可能牺牲一些美学效果。

高值:较高的 --stylize 值(最高可达 1000)可能会增强图像的美学和艺术效果,但可能会降低对提示的精确理解。

支持的功能和参数:

支持的功能包括 --ar, --chaos, --weird, --tile, --stylize, --style raw, Vary (subtle), Vary (strong), Remix, /blend, /describe(仅 V5 版本)。
#Midjourney V6上线

一些反馈发现(单簧管总结):

- 提示词长度现在是350+
- 您可以指定颜色和其他细节
- 你可以在画布上放置你想要的东西,如添加文本
- 您可以提示多个主题
- 你可以像ChatGPT一样和Midjourney聊天
- V6能够理解标点和语法的细微差别(即:熊猫吃、射、走)
- 可以使用V6制作niji那样的漫画
- 可以通过描述图像来为其添加框架或边框

如何启用:在 /settings 下拉菜单中选择 V6,或在提示后输入 --v 6。

官方对V6 模型的新特性:

1、更准确的提示跟随和更长的提示

•改进的响应能力:V6 模型对用户输入的响应更加准确,能够更好地理解和执行复杂的提示。

•处理更长的提示:V6 能够处理更长的文本提示,这意味着用户可以提供更详细的描述和指令,从而获得更精确的输出结果。

2、提升的连贯性和模型知识

•改善的连贯性:V6 在生成内容时的连贯性得到了显著提升,这使得输出结果更加流畅和自然。

•增强的模型知识:V6 拥有更丰富的知识库和更好的理解能力,能够更准确地处理复杂的查询和任务。

3、改进的图像提示和混合

•增强的图像生成:V6 在图像生成方面的能力得到了增强,能够根据文本提示创建更精细和逼真的图像。

•改善的图像混合:V6 提供了更好的图像混合功能,使得不同元素和风格的结合更加和谐自然。

4、文本绘制能力

•用户可以在他们的提示中指定要在图像上显示的文本,模型将会根据这些指示在生成的图像中包含相应的文本内容。

•绘制文本:V6 可以在图像中绘制文本。为了获得最佳效果,文本应该用引号标出。这样做可以帮助模型区分哪些是描述性的提示,哪些是实际要在图像中呈现的文本。

•风格调整:使用 --style raw 或较低的 --stylize 值可能有助于提高文本绘制的准确性和质量。这是因为不同的风格设置可能会影响文本在图像中的呈现方式。

例如,如果用户想要生成一张图像,上面写着用马克笔在便利贴上写的“Hello World!”,他们可以使用类似于以下的提示:“/imagine a photo of the text 'Hello World!' written with a marker on a sticky note --ar 16:9 --v 6”。
也许XR的普及会成为解决机器人manipulation缺乏数据问题的重要拐点?
人形机器人,先看特斯拉。
🎨 AI 大事件:Midjourney 6.0 正式上线了!

初步汇总一些海外玩家发现的新特性:

- 自然语言理解大幅提升,是 V6 的一大亮点。
- V6 更写实的处理能力, (图1是与V5.2 的对比提示:写实照片,超写实,侧视美女的脸,脸上的水珠,高度细致,肖像,数码摄影,佳能)
- V6 可以书写文字。 (图2是一次性出图,没有后期)
- 对手指处理有了大幅提升,例如在图3中,手、手指、酒杯以及保持酒杯形状一致方面有了明显进步。
- 场景丰富性似乎再上台阶, 图4的Hello Kitty

你也试试,进入 /settings,应该可以在下拉菜单中看到 6.0 Beta 版。
花半天开发的网站上线一周,今日3000人访问,他是怎么做到的?

简单几步,让你有一个自己的谷歌 Gemini Chat Bot:
0. 你需要先准备好一个 Vercel 账号;
1. 打开 https://makersuite.google.com/app/apikey 获取一个 apiKey;
2. 打开 https://github.com/antergone/palm-proxy 一键部署代码到 Vercel,你就有了一个自己的 proxy ,记住域名备用;
3. 打开 https://github.com/babaohuang/GeminiProChat 一键部署代码到 Vercel ;
4. 填写环境变量 GEMINI_API_KEY 和 API_BASE_URL ,分别是第1步和第2步得到的值;
5. 直接用 Vercel 提供的子域名,或者绑定一个自己的域名,开始使用 Gemini ;
6. 阅读文章了解更多 https://mp.weixin.qq.com/s/uSsCH3bFm_qtN_ZVR9f4Rw。
🙋🏻‍♂️怎么把一份英文PDF完整地翻译成中文?
@ShowMeAI研究中心搜集到了这8种方法!!!

1、DeepL(网站) https://www.deepl.com/translator
点击页面「翻译文件」按钮,上传PDF、Word或PowerPoint文件即可

2、沉浸式翻译(浏览器插件) https://immersivetranslate.com
安装插件后,点击插件底部「更多」按钮,选择「制作双语BPUB电子书」、「翻译本地PDF文件」、「翻译THML / TXT文件」、「翻译本地字幕文件」

3、calibre(电子书管理应用) https://calibre-ebook.com/zh_CN
下载并安装 calibre ,并安装翻译插件「Ebook Translator」

4、谷歌翻译(网页) https://translate.google.com/
使用工具把 PDF 转成Word,再点击谷歌翻译「Document」按钮,上传 Word 文档

5、百度翻译(网页)https://fanyi.baidu.com/
点击导航栏「文件翻译」,上传 PDF、Word、Excel、PPT、TXT 等格式的文件,支持选择领域和导出格式(不过进阶功能基本都需要付费了)

6、彩云小译(App)
下载后点击「文档翻译」,可以直接导入PDF、PDF、Word、Excel、PPT、TXT、epub、srt 等格式的文档并开始翻译(不过有免费次数限制且进阶功能需要付费)

7、微信读书(App)
下载App后将PDF文档添加到书架,打开并点击页面上方「切换成电子书」,轻触屏幕唤出翻译按钮

8、浏览器自带的翻译功能
如果一些 PDF 太大,翻译工具不支持,除了将 PDF 压缩或者切分外,还可以转成 HTML 格式,然后使用浏览器自带的网页翻译功能

有需要的朋友mark住吧🕺🏻🕺🏻🕺🏻
用 AI 不应该总结简单的文章来帮自己提高效率。

相反,应该让他帮自己读复杂的论文,然后不厌其烦地做比喻,举例子,帮助自己去理解。

把自己从主体上挪开,它懂的自己多多了。而且不厌其烦,脾气贼好。
昨晚心血来潮,把微信浮窗里的几十篇文章给消掉了。

消除过程中发现,绝大多数公众号文章,根本不值得点开读全文。

用AI去问标题中吸引我的点,就能满足我的好奇心了,而且更通俗易懂和简单明了。

举几类常见的例子:

1、why类型的文章,比如《我们为什么反感别人摔手机?》

我确实对原因比较好奇,所以才把文章放进浮窗的。但我又不想看东方小孙的脸,于是就把文章标题和链接直接发给kimi,人家分分钟就总结完了。

答案我跟原文对照了一下,大差不差。坦白讲,我更喜欢AI的精炼总结,不喜欢公众号文章的插科打诨和“旁征博引”。

尤其是晚上累的时候,求求你别哔哔,直接给我答案就好,简单满足我好奇心就行。

2、what类文章,比如《字节自研大模型,却因用ChatGPT被封号惹争议?官方回应了》

看标题后,我对文章是感兴趣的,特别想知道细节回应了啥。但文章有6千多字,洋洋洒洒地不知道扯了多少无关内容。

于是,我又把链接发给kimi,并问了句官方回复是啥?不到一分钟,小几百字的总结就出来了。

舒服,我就只想看这部分,其他的别来浪费我时间。

3、how类,比如《我用了2周PIKA1.0后,总结了10个宝藏使用技巧 - 建议收藏公测后用》

一口气看完8千多字的10个技巧,对我来说挑战实在太大了,也难怪我也放进浮窗里吃灰。

一样的,我还是把文章链接发给kimi,并问他10个小技巧具体是什么。人家咔咔就总结好了,看完后发现,这10个当中,可能一半我目前都不用看。

4、不知道怎么分类的吃瓜文章,比如《笑拥了,脉脉连自己的负面都删不了》

看到脉脉确实想吃瓜,而且作者以往的文章还不错。但吃瓜也不能无脑,于是问了下kimi,文章核心观点和论据是什么?

总结完发现,嚯,原来是篇PR稿,幸亏没浪费时间看……

——

综上不难发现,绝大多数的文章,直接把标题中感兴趣的问题和链接一起发给kimi,就可以又快又准的总结好了。

公众号发展这么多年,一般的文章都知道把最吸引人的部分放进标题,所以很多时候连问题都不用想,直接复制部分或全部标题内容,就可以达到“太长不看”的效果。

说个题外话,以前挺讨厌标题党的,经常被骗进去浪费时间。现在还有点感谢标题党,把最值得了解的问题都放进标题里了,我问AI的时候都不用自己想问题。

对了,极少数标题也不知所云的,就问问核心观点和论据,基本上也够了。
终于见到实物了🫡感谢机器人的蓬勃发展,为通信产业带来第二春
Back to Top