十分感谢作者的rex-omni优秀工作!
关于负文本训练,我有两个疑问,希望您可以解答:
1、负文本训练是在SFT环节,还是GRPO环节,还是SFT、GRPO环节都需要,两个环节的负文本采样策略有没有不同之处;
2、负文本训练是只应用于诸如obj365、openimage这种检测数据,还是flickr30k以及HumanRef这种Grounding、Referring数据也应有负文本;如果是,负Grouning、Referring Data的负文本采样策略是否应该从一个global categories list(出现次数大于100的所有categories)中随机抽取。
十分感谢作者的rex-omni优秀工作!
关于负文本训练,我有两个疑问,希望您可以解答:
1、负文本训练是在SFT环节,还是GRPO环节,还是SFT、GRPO环节都需要,两个环节的负文本采样策略有没有不同之处;
2、负文本训练是只应用于诸如obj365、openimage这种检测数据,还是flickr30k以及HumanRef这种Grounding、Referring数据也应有负文本;如果是,负Grouning、Referring Data的负文本采样策略是否应该从一个global categories list(出现次数大于100的所有categories)中随机抽取。