Instructions to use ifmylove2011/girlslike-zimage with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use ifmylove2011/girlslike-zimage with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("Tongyi-MAI/Z-Image,Tongyi-MAI/Z-Image-Turbo", dtype=torch.bfloat16, device_map="cuda") pipe.load_lora_weights("ifmylove2011/girlslike-zimage") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Inference
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Draw Things
- DiffusionBee
关于krea 2的多角色lora训练
大佬,您有没有试过将多个角色塞进一个lora里呢?角色多的情况下有没有必要提高rank使模型学习更多的内容?之前想做多个lora角色合影的照片,但是发现通常排在第一位的lora人物会大量影响第二位的人物形象,最后使得出来的人物像是两人形象特征的融合,于是想尝试将多个角色放进一个lora里,不知道大佬你之前有没有这样做过。
好像您以前似乎是做过两个角色形象融合的模型,那么要避免角色形象融合,光靠打标区分足够么?
大佬,您有没有试过将多个角色塞进一个lora里呢?角色多的情况下有没有必要提高rank使模型学习更多的内容?之前想做多个lora角色合影的照片,但是发现通常排在第一位的lora人物会大量影响第二位的人物形象,最后使得出来的人物像是两人形象特征的融合,于是想尝试将多个角色放进一个lora里,不知道大佬你之前有没有这样做过。
好像您以前似乎是做过两个角色形象融合的模型,那么要避免角色形象融合,光靠打标区分足够么?
以前试过,但效果都不行,这个得看模型本身的能力,目前来说,krea2是可以的,zimage很难;
之前的形象融合lora,是物理意义上的融合,直接把训练完的Lora参数通过算法加权在一起,有点类似把lora堆叠一起生图,和想训练出多角色lora完全不是一条路子;
这个从画内置人物就大概能看出来,在zimage中,输入提示词“双人肖像照,左边是杨幂,杨幂穿着红色长裙,右边是刘亦菲,刘亦菲穿着蓝色T恤”,就会出现你说的形象特征混合的问题,杨也像刘,刘也像杨,这也是以前生图模型普遍的问题;
而在krea2中,输入提示词“Portrait of two people, with Alexandra Anna Daddario on the left wearing a red long dress and Scarlett Johansson on the right wearing a blue T-shirt",是可以相对清晰画出达达里奥和斯嘉丽的各自特征的,解耦效果好得多;
所以krea2理论上是可以训练多角色lora的;
社区中我也看到过成功的krea2案例了,两个角色的比较多,据说超过5个就很再画出各自特征了,但两三个是比较稳定的;
结合以前的经验和现在社区的说法,krea2靠打标训练两三个角色的多角色lora是足够的,打标需要注意的就是随时要注意方位,左边右边、前景中景以及尽可能使用触发词代指,而非”她“这种代词;
至于rank容量的话,可以尝试提高,但不用提得太大,无论怎么说人物信息尤其是脸部信息是很小的,对于两个人物而言,可能rank8也已经是足够的了,因为理论上而言,rank2的信息就足够存储一张人脸的五官特征;
这个倒也提醒了我,我有空也试一下,有结果会回来告知你。
krea2确实相对比较容易分离概念,也能更稳定地复现多概念;
例图里lora强度为1.5,已经比较明显地分离两个角色的特征了,虽然细看好像还能是看出有点混合,但比之前的模型已经有很大进步了;
1.0强度确实还是不够,相似度不高且特征混合,这应该是我素材和训练步数的问题;
为了快速验证可行性,我直接把以往的素材强行左右拼接起来,变成一个新素材,caption也比较简单,类似“personA,personB,双人场景。画面左侧的 personA 是一名[年龄/性别],[肤色],[发色和发型],[面部特征],穿着[服装],[配饰或其他明显特征]。画面右侧的 personB 是一名[年龄/性别],[肤色],[发色和发型],[面部特征],穿着[服装],[配饰或其他明显特征]。”这种格式,训练步数也像单角色一样训练不到1000步——目前来看应该是不够的,如果想用更低强度进行使用的话;
不过至少说明之前的经验仍然是可行的——注意caption中方位、触发词的使用以及使用稍高的分辨率(毕竟多人更占空间),也确实不需要太高的rank;
触发词可能也需要变动一下,名字放在首位权重似乎太高了,作为首位触发词,很容易出现第一个人物把后续所有人物的特征都混在一起了,第二个人物反倒可以保持更明显的分离特征,所以应该可以适当往后放增加泛化性;
随之变动的还有素材中人物的方位,像我这么固定左A右B的肯定不够好,方位随机一些,触发词也能随之变化权重;
另外可能也需要更低的学习率,目前3e-4虽然勉强可行但有点高了,拉低学习率、拉长一些步数应该会稳定许多;
后面有空再试试;
总之可以放手去尝试。
好的,我也去尝试做个训练试试
