All authors

Claude Skills by hiyenwong
github.com/hiyenwong9,934 skills5 installs19,223 views
- Arxiv 2608 20047 Auditing Cross Lingual Fairness In Language ModelAuditing Cross-Lingual Fairness in Language Model Watermarking (arXiv: 2608.20047)Votes: 0GitHub stars: 3
- Arxiv 2608 20052 Decovae A Lightweight Interpretable Trend SeasonalDecoVAE: a Lightweight Interpretable Trend-Seasonal VAE Framework for Efficient Probabilistic Time Series Forecasting (arXiv: 2608.20052)Votes: 0GitHub stars: 3
- Arxiv 2608 23028v1 Psychjail Exploring Psychological Jailbreaks Via M**arXiv ID:** 2608.23028v1 **Authors:** Zeyu Feng, Qingyu Wu, Yuzhe Luo, Hua Cheng **URL:** http://arxiv.org/abs/2608.23028v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 23035v1 Mobilepa Bench Benchmarking Mobile Planner Agents**arXiv ID:** 2608.23035v1 **Authors:** Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi **URL:** http://arxiv.org/abs/2608.23035v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 23065v1 Cultural Moment Benchmark Evaluating Video Cultura**arXiv ID:** 2608.23065v1 **Authors:** Burak Satar, Zhixin Ma, Cheng Yu-Tong, Huy Hoang Tran, Phuong Anh Nguyen, Chong-Wah Ngo **URL:** http://arxiv.org/abs/2608.23065v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 23149v1 Language Chain In Alignment Cross Lingual Ranking**arXiv ID:** 2608.23149v1 **Authors:** Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim **URL:** http://arxiv.org/abs/2608.23149v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 23497v1 Mitigating Reasoning Induced Misalignment Via Safe**arXiv ID:** 2608.23497v1 **Authors:** Yipeng Zhao, Qishun Yang, Shenzhe Zhu, Shu Yang, Di Wang **URL:** http://arxiv.org/abs/2608.23497v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 23525v1 Earthverse Benchmarking Scientific Agents Across D**arXiv ID:** 2608.23525v1 **Authors:** Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao **URL:** http://arxiv.org/abs/2608.23525v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 25429v1 Distance Is Not Enough Forget Retain Alignment Gap**arXiv ID:** 2608.25429v1 **Authors:** Yi Chen, Hanna Hsieh, Shuhong Liu, Chuanbo Hua, Zihan Ma, Kun Wang, Joo-Young Kim **URL:** http://arxiv.org/abs/2608.25429v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 25452v1 Vga Benchv2 An Expanded Unified Benchmark And Mult**arXiv ID:** 2608.25452v1 **Authors:** Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin **URL:** http://arxiv.org/abs/2608.25452v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 25489v1 A Storage Retrieval Gap In Parametric Knowledge Gr**arXiv ID:** 2608.25489v1 **Authors:** Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Volker Tresp **URL:** http://arxiv.org/abs/2608.25489v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 25490v1 Mmjailbench A Factorized Benchmark For Disentangli**arXiv ID:** 2608.25490v1 **Authors:** Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu **URL:** http://arxiv.org/abs/2608.25490v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 25586v1 Individual Fairness In Hierarchical Clustering**arXiv ID:** 2608.25586v1 **Authors:** Binita Maity, Shrutimoy Das **URL:** http://arxiv.org/abs/2608.25586v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 25940v1 A Statistical Audit Of Physical Ai Benchmark Redun**arXiv ID:** 2608.25940v1 **Authors:** Zaruhi Navasardyan, Hrant Davtyan **URL:** http://arxiv.org/abs/2608.25940v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 25941v1 When Pruning Meets Interpretability Preserving Spa**arXiv ID:** 2608.25941v1 **Authors:** Suchit Gupte, Xueru Zhang, Mohammad Mahdi Khalili **URL:** http://arxiv.org/abs/2608.25941v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 25970v1 Panda Prototype Anchored Alignment For Partially U**arXiv ID:** 2608.25970v1 **Authors:** Sheethal Bhat, Mahfuzur Rahman Chowdhury, Paula Andrea Perez-Toro, Stephan Wunderlich, Rose Dawn Bharat, Siming Bayer, Andreas Maier **URL:** http://arxiv.org/abs/2608.25970v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 26613v1 Technical Comparative Benchmarking Study Advanced**arXiv ID:** 2608.26613v1 **Authors:** Majid Masoumi, Asghar Dashtiy, Mohammad Dehghan, Mina Rajabi **URL:** http://arxiv.org/abs/2608.26613v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 26713v1 Aescanvas A Large Scale Dataset And Benchmark For**arXiv ID:** 2608.26713v1 **Authors:** Xuanwei Hu, Haoyu Dong, Kejun Wu, Tianyi Liu, Jianjun Gao **URL:** http://arxiv.org/abs/2608.26713v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 26732v1 Rethinking Message Passing As Retrieval For Text A**arXiv ID:** 2608.26732v1 **Authors:** Jintang Li, Yuhong Chen, Ruofan Wu, Binli Luo, Jiayi Ji, Hui Li, Rongrong Ji **URL:** http://arxiv.org/abs/2608.26732v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 26846v1 Evaluating Confidence Gated Retrieval With Matched**arXiv ID:** 2608.26846v1 **Authors:** Prateek Chhikara **URL:** http://arxiv.org/abs/2608.26846v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 27021v1 Fault Bench Towards Benchmarking Network Troublesh**arXiv ID:** 2608.27021v1 **Authors:** Kuan-Hao Tseng, Niruth Bogahawatta, Yasod Ginige, Kunjan Patel, Kosta Dakic, Suranga Seneviratne **URL:** http://arxiv.org/abs/2608.27021v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 27150v1 Antshapes Benchmarking Datasets For Event Based Ne**arXiv ID:** 2608.27150v1 **Authors:** M. Middleton, H. Kayan, B. Sen Bhattacharya, T. Ali, E. Baikas, M. Vousden, C. Perera, O. Rhodes, E. Gheorghiu, M. A. Trefzer **URL:** http://arxiv.org/abs/2608.27150v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 27340v1 Not All Eval Awareness Is Equal Capabilities Frami**arXiv ID:** 2608.27340v1 **Authors:** Allison Zhuang, Santiago Aranguri **URL:** http://arxiv.org/abs/2608.27340v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 27391v1 Corporatebench Large Scale Q A Benchmarking With T**arXiv ID:** 2608.27391v1 **Authors:** Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov **URL:** http://arxiv.org/abs/2608.27391v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 27442v1 From Static To Dynamic Benchmarking Real World Cod**arXiv ID:** 2608.27442v1 **Authors:** Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan, Hongyu Zhang, Xilin Liu, Yuchi Ma, Zibin Zheng **URL:** http://arxiv.org/abs/2608.27442v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 30418v1 Benchmarking External Generalization Of Spd Matrix**arXiv ID:** 2608.30418v1 **Authors:** Ce Ju, Antoine Collas, Florent Bouchard, Bertrand Thirion **URL:** http://arxiv.org/abs/2608.30418v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 30429v1 Evoskill Injection Red Teaming Autonomous Skill Ge**arXiv ID:** 2608.30429v1 **Authors:** Doyun Kim, Chanwoo Kim, Sugyeong Eo, Yeo-Chan Yoon, Chanjun Park **URL:** http://arxiv.org/abs/2608.30429v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 30475v1 Imageeval 2026 Culturally Grounded Arabic Multimod**arXiv ID:** 2608.30475v1 **Authors:** Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam **URL:** http://arxiv.org/abs/2608.30475v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 30585v1 The Safety Relay In Roleplay Jailbreaks A Componen**arXiv ID:** 2608.30585v1 **Authors:** Md Mokarram Chowdhury, Ernie Chang, Yang Li **URL:** http://arxiv.org/abs/2608.30585v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 30606v1 Generative Retrieval For E Commerce Jointly Learni**arXiv ID:** 2608.30606v1 **Authors:** Songtao Fang, Zihao Xu, Shaowei Wei, Jin Zhang, Zhuojun Wang **URL:** http://arxiv.org/abs/2608.30606v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 30835v1 Reliable Benchmarking Of Artifact Detection In Com**arXiv ID:** 2608.30835v1 **Authors:** Konstantinos Moutselos, Ilias Maglogiannis **URL:** http://arxiv.org/abs/2608.30835v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 30846v1 Vfr Audit Verdict Level Reliability For Fairness A**arXiv ID:** 2608.30846v1 **Authors:** Md Jannatul Rakib Joy, Viet Vo, Caslon Chua **URL:** http://arxiv.org/abs/2608.30846v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 31108v1 Stress Testing Efficient Responsible Ai Evaluation**arXiv ID:** 2608.31108v1 **Authors:** Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou, Shaina Raza **URL:** http://arxiv.org/abs/2608.31108v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02059v1 Dochop Benchmarking Out Of Domain Multi Hop Reason**arXiv ID:** 2609.02059v1 **Authors:** Zhuoran Yu, Le Thien Phuc Nguyen, Jaden Park, Xinyi Gu, Zexue He, Soochahn Lee, Rogerio Feris, Yong Jae Lee **URL:** http://arxiv.org/abs/2609.02059v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02162v1 Gencar Generative Counterfactual Alignment With Ri**arXiv ID:** 2609.02162v1 **Authors:** Qianqian Wang, Yunshan Li, Jiawen Zeng, Wenwu Gong, Lili Yang **URL:** http://arxiv.org/abs/2609.02162v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02172v1 Breadth Beats Depth Improving Gcg Based Jailbreak**arXiv ID:** 2609.02172v1 **Authors:** Shiliang Xiao, Jingsong Wei, Yuzhi Liang, Yufan Zheng, Xia Li, Qiliang Lin **URL:** http://arxiv.org/abs/2609.02172v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02277v1 Auditory Illusion Benchmark For Large Audio Langua**arXiv ID:** 2609.02277v1 **Authors:** Hayoon Kim, Eunice Hong, Kyogu Lee **URL:** http://arxiv.org/abs/2609.02277v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02336v1 Sala Semantic Aware Logical Alignment For Complex**arXiv ID:** 2609.02336v1 **Authors:** Zhao Ji, Wenqing Chen, Zhixuan Chu, Jianxing Yu, Jingping Liu, Shanhe Zhao, Zibin Zheng **URL:** http://arxiv.org/abs/2609.02336v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02339v1 Agi Maze Prediction Datasets A Compact Benchmark F**arXiv ID:** 2609.02339v1 **Authors:** Alexey Potapov **URL:** http://arxiv.org/abs/2609.02339v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02379v1 Multighostbench A Multilingual Benchmark For Long**arXiv ID:** 2609.02379v1 **Authors:** Matteo Greco, Anudeex Shetty, Andrea Tagarelli, Jey Han Lau **URL:** http://arxiv.org/abs/2609.02379v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02459v1 Civbench A Long Horizon Benchmark For Tool Mediate**arXiv ID:** 2609.02459v1 **Authors:** Austin Tudor David Andrews, Liam Wilkinson, Jamie Heagerty, Harry Coppock, Jakob Nicolaus Foerster, Rui Ponte Costa **URL:** http://arxiv.org/abs/2609.02459v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02486v1 Visar Training Free Adaptive K Retrieval For Visua**arXiv ID:** 2609.02486v1 **Authors:** Adrien Mialland, Marc Plantevit, Julien Gallois, Céline Robardet **URL:** http://arxiv.org/abs/2609.02486v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02502v1 Blending Concepts Benchmarking Visual Metaphor Gen**arXiv ID:** 2609.02502v1 **Authors:** Chuer Chen, Zichen Wang, Yi He, Zhengxi Yu, Nan Cao **URL:** http://arxiv.org/abs/2609.02502v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02731v1 Rvsd Retrieval Vision Sparse Decoding For Mitigati**arXiv ID:** 2609.02731v1 **Authors:** Canjie Liu, Jiawen Kang, Jinbo Wen, Zishao Zhong **URL:** http://arxiv.org/abs/2609.02731v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 02861v1 Towards Trustworthy Autonomous Robots An Explainab**arXiv ID:** 2609.02861v1 **Authors:** Cagri Temel **URL:** http://arxiv.org/abs/2609.02861v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 03355v1 Alra Adaptive Local Relational Alignment For Logit**arXiv ID:** 2609.03355v1 **Authors:** Quang Hoang Trung, Quang Huu Hieu, Nguyen Van Hoang Phuc, Vo Nguyen Le Duy **URL:** http://arxiv.org/abs/2609.03355v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 03376v1 Spruce Scalable Private Outsourced Retrieval Using**arXiv ID:** 2609.03376v1 **Authors:** Peichun Hua, Yunming Xiao **URL:** http://arxiv.org/abs/2609.03376v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 03507v1 Longcounsel 8 A Benchmark Suite For Longitudinal D**arXiv ID:** 2609.03507v1 **Authors:** Jiayi Li, Zhaomin Wu, Bingsheng He **URL:** http://arxiv.org/abs/2609.03507v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 03901v1 Comparing Retrieval Methods For Academic Advisor D**arXiv ID:** 2609.03901v1 **Authors:** Biraj Subedi **URL:** http://arxiv.org/abs/2609.03901v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2609 04007v1 Robustseiz An Open Source Framework For Benchmarki**arXiv ID:** 2609.04007v1 **Authors:** Mohammad Mohammadi, Alireza Zarei **URL:** http://arxiv.org/abs/2609.04007v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3